01핵심 개요
조코딩(JoCoding) 채널의 주간 AI 뉴스 브리핑으로, 이번 주는 오픈AI의 차세대 모델 아스트라(Astra) 내부 버전이 수학·이론 컴퓨터 과학의 10대 미해결 난제를 풀어낸 소식을 헤드라인으로 다룬다. 최소 10년 이상 주요 진전이 없던 문제들(예: 고차원 구형 패킹 밀도의 새로운 상한값, 이진 코드·구형 코드 관련 난제)을 AI가 해결했으며, 단순 할루시네이션이 아니라 각 논증을 린(Lean) 인증서로 공식화해 검증 가능하게 만들었다는 점이 핵심이다. 진행자는 이를 특이점 논의와 연결지어 시사점을 제시한다.
이어 LLM 영역에서는 GPT 5.6 계열의 가격 인하(루나 80%, 테라 20% 인하)와 ARC-AGI3 벤치마크에서 하네스(harness) 조정만으로 점수를 13.3%에서 38.3%로 약 3배 끌어올린 사례가 소개된다. 오픈웨이트 진영에서는 딥시크 V4 플래시(DeepSeek V4 Flash)가 정식 버전으로 공개되어 MIT 라이선스로 배포되었으며, 오퍼스 4.8급 성능에 페이블 5 대비 105배 저렴한 가격이 강조된다.
영상 생성 AI 분야는 이번 주의 또 다른 축으로, 시덴스(Seedance) 2.5의 글로벌 런칭(네이티브 30초·최대 3분, 마야/블렌더 플러그인), 오픈웨이트 멀티모달 미니맥스 H3(MiniMax H3), 그록(Grok) 이미지·보이스, 크리스퍼 위스퍼 2.0 ASR 등이 다뤄진다. 마지막으로 구글의 제미나이 로보틱스 2(Gemini Robotics 2)와 피규어(Figure) 03 휴머노이드 데모로 로보틱스 진전을 정리하며, 클로드 코드 팀의 "프롬프트 80% 삭감" 컨텍스트 엔지니어링 조언도 함께 전한다.
02LLM·모델 발표 (오픈AI·딥시크)
- 오픈AI 아스트라(Astra) — 10대 난제 해결: 차세대 주요 모델 아스트라의 내부 버전이 수학·이론 컴퓨터 과학 분야의 오랜 미해결 문제 10개를 해결. 고차원 구형 패킹 밀도의 새로운 상한값, 이진 코드·구형 코드 등 유명 난제 포함. 각 논증을 린(Lean) 인증서로 공식화해 검증 가능하게 제출한 점이 할루시네이션과의 결정적 차이.
- GPT 5.6 — 가격 대비 성능 확장 (7월 30일부): 가장 가벼운 모델 루나(Luna) 80% 인하 → 입력·출력 1.2달러 수준. 중간 모델 테라(Terra) 20% 인하 → 입력 2달러, 출력 12달러. 5.6 솔 수준을 유지하며 스탠더드 대비 최대 2.5배 빠른 속도를 2배 가격에 제공. 진행자는 딥시크의 저가 공세에 대응한 조치로 해석.
- ARC-AGI3 하네스 효과: 동일 모델에서 하네스(harness) 조정만으로 점수 3배 상승. 기본 오픈AI 하네스에서는 약 10% 초반이었으나, 리즈닝을 보유하며 압축하는 방법론 적용 시 13.3% → 38.3%로 급등. 벤치마크가 순수 모델 성능뿐 아니라 API 설정·하네스 설계·프롬프트 방식까지 함께 측정한다는 시사점.
- 딥시크 V4 플래시(DeepSeek V4 Flash) — 정식 공개: 프리뷰 이후 정식 버전 출시. API + 오픈웨이트 + MIT 라이선스. 이전 프로 모델을 전반적으로 능가, 오퍼스 4.8에 견주는 성능. 아티피셜 애널리시스 기준 구글 최첨단 플래시 모델과 동급 점수. 가격은 제미나이 3.5 플래시 라이트보다 성능은 좋고 더 저렴, 페이블 5 대비 105배 저렴.
03오픈웨이트 로컬 실행·양자화
딥시크 V4 플래시가 오픈웨이트로 풀리면서 언슬로스(Unsloth) 등에서 양자화 모델이 제공될 전망. 로컬 실행 하드웨어 요구사항은 다음과 같다.
| 양자화 | 요구 메모리·환경 | 비고 |
|---|---|---|
| 4비트 (거의 손실 없음) | 약 162GB | 고사양 필요 |
| 3비트 | 128GB 통합 메모리 | DGX Spark 등에서 실행 가능 |
| 2비트 | 128GB에서 넉넉 | 여유 있는 실행 |
DGX Spark처럼 대용량 통합 메모리를 갖춘 환경 보유자라면 로컬 구동을 시도해 볼 만하다는 평가.
04영상·음성 생성 AI
- 시덴스(Seedance) 2.5 — 글로벌 런칭: 누구나 사용 가능하나 가격은 비쌈. 단일 생성으로 네이티브 30초 비디오, 인터랙티브 편집·롱 비디오로 최대 3분 영화급 프로덕션 파이프라인. 마야·블렌더 플러그인 제공(3D 도구 결과물을 영상으로 변환). 로지텍 광고, 프로즌 타임 효과, 케이팝 뮤비 등 데모. 드리미나(Dreamina)에서 생성 가능하나 1회당 약 1만 원 소요.
- 미니맥스 H3(MiniMax H3) — 오픈 멀티모달 영상 모델: 아티피셜 애널리시스 리더보드에서 시덴스 2.0을 상회. 텍스트-비디오·이미지-비디오 2위, 비디오 에디팅 리더보드 1등(옴니 플래시·시덴스 초과, 오픈웨이트 중 1위). 웨이트는 6시간 뒤 공개 예정. 컴피(Comfy) 창립자가 8비트 가중치·480p급 해상도에서 124프레임 비디오를 10분 이내 생성, RTX 3060 한 장으로 구동 가능성 언급. K드라마 데모.
- 이매진 비디오 1.5 / 그록 이미지: 이매진 비디오 1.5 개선. 그록은 레퍼런스 이미지 기반 생성 가능, 15초·1080p까지 지원.
- 그록 보이스 띵크 패스트(Think Fast) 2.0: 추론이 들어간 음성 모델(음성 추론·대화·도구 사용). GPT 리얼타임 2.1, 제미나이 3.1 플래시 대비 우세. 음성 추론 97.2점, 대화 역학은 소폭 낮음. 속도 빠름 — 상담원·실시간 통화 서비스에 적합.
- 크리스퍼 위스퍼(Crisper Whisper) 2.0 — 오픈웨이트 ASR: 소리→텍스트 변환. 일레븐랩스 스크라이브 V2(79.2점) 대비 87.8점으로 현존 최고 수준, MAI 트랜스크라이브 초과. 웃음 등 감정 표현을 별도 처리, 한글 전사도 양호.
05로보틱스·컨텍스트 엔지니어링
- 제미나이 로보틱스 2(Gemini Robotics 2): 청소·포도를 지퍼백에 넣기, 전구 빼기, 쓰레기봉투 묶기 등 정교한 자율 조작 데모. 세 가지 모델 공개 — VLA(비전-랭귀지-액션) 모델, 로보틱스 ER2 리즈닝 모델, 온디바이스 2 모델(오프라인/네트워크 단절 대응).
- 피규어(Figure) 03: 손잡이를 안정적으로 잡고 계단을 사람처럼 차근차근 오르는 데모 공개.
- 클로드 코드 컨텍스트 엔지니어링(보리스 체르니 등): Y 콤비네이터 강연에서 클로드 코드 헤드 보리스 체르니가 시스템 프롬프트 80% 이상 삭감을 소개. 모델 지능 향상에 따라 기존 프롬프트·코드를 삭제하고 생 모델의 반응을 관찰하며 필요한 부분만 다시 채우는 방식 채택. "뉴 룰즈 오브 컨텍스트 엔지니어링" 글은 상세 지침 대신 모델의 자율 판단 위임, 도구도 파라미터·구조만 명확히 하면 예시 없이 사용 가능하다고 정리.
- 안드레 카파시 벤치마크 아이디어: 자전거 탄 펠리컨 SVG가 이미 잘 나오게 됨 → 반지의 제왕 첫 단락으로 자바스크립트 애니메이션(2D는 어려워 폴리곤 3D로 한 장면 렌더링) 생성을 새 비교 벤치마크로 제안.
06활용 시나리오
- 가성비 API 파이프라인: 딥시크 V4 플래시(MIT·오픈웨이트, 페이블 5 대비 105배 저렴)로 웬만한 가성비 작업 대체. GPT 5.6 루나/테라 인하로 달러당 성능 최적화.
- 로컬·온프레미스 추론: DGX Spark 등 128GB 통합 메모리 환경에서 3비트 양자화 딥시크 V4 구동, 데이터 외부 유출 없이 로컬 처리.
- 콘텐츠·영상 제작: 시덴스 2.5로 30초~3분 광고·뮤비, 마야/블렌더 3D 워크플로우 연동. 저비용 실험은 미니맥스 H3(오픈웨이트, RTX 3060급) 활용.
- 음성 서비스·자막: 그록 보이스 2.0으로 실시간 상담·통화 봇, 크리스퍼 위스퍼 2.0으로 고정확도 한/영 자막 전사(감정 표현 태깅).
- 프롬프트 다이어트: 기존 하네스·스킬·시스템 프롬프트를 80% 삭제 후 생 모델에서 필요한 부분만 재추가해 성능·비용 개선.
07현황 및 전망
AI가 인간 박사급도 풀지 못한 10대 난제를 린 인증서로 검증 가능하게 해결하면서, 진행자는 특이점이 임박했다는 인식과 함께 관련 전공 진로 인구 감소 가능성까지 언급한다. 모델 경쟁은 순수 성능뿐 아니라 하네스·API 설정 등 "눈에 띄지 않는 요소"로 승부가 갈리며(ARC-AGI3 3배 사례), 오픈웨이트(딥시크 V4, 미니맥스 H3, 크리스퍼 위스퍼 2.0)가 상용 최고 모델을 위협하는 가격·성능 역전이 이번 주의 큰 흐름이다.
영상 생성은 30초~3분 네이티브 생성과 3D 툴 연동 플러그인으로 실사용 프로덕션 단계에 진입했고, 오픈웨이트 미니맥스 H3의 웨이트 공개가 임박(6시간 뒤)해 로컬 영상 생성의 대중화가 예상된다. 로보틱스 역시 제미나이 로보틱스 2의 VLA·리즈닝·온디바이스 3종과 피규어 03 계단 등반으로 조작·이동 정교화가 진전 중이다. 참고로 구글 제미나이는 8월 4일까지 무료 비디오 10개를 제공한다.
08용어 사전
| 용어 | 한줄 설명 | 비유 |
|---|---|---|
| 아스트라(Astra) | 오픈AI 차세대 주요 모델, 10대 난제 해결 내부 버전 | 천재 수학자 신입 |
| 린(Lean) 인증서 | 수학 증명을 기계가 검증 가능하게 공식화하는 방법론 | 채점 가능한 답안지 |
| 하네스(harness) | 모델을 감싸 실행하는 API·설정·프롬프트 구성 환경 | 선수의 장비·전략 |
| ARC-AGI3 | 일반 지능을 재는 어려운 벤치마크 | AGI 수능 시험 |
| 딥시크 V4 플래시 | MIT 라이선스 오픈웨이트 고가성비 모델 | 무료 배포 명품 |
| 오픈웨이트 | 가중치를 공개해 누구나 다운로드·실행 가능한 모델 | 공짜 설계도 |
| 양자화(quantization) | 가중치를 저비트로 압축해 메모리를 줄이는 기법 | 파일 압축 |
| 시덴스(Seedance) 2.5 | 최대 3분 영상 생성 및 3D 툴 플러그인 지원 모델 | AI 영화 스튜디오 |
| 미니맥스 H3 | 오픈웨이트 멀티모달 영상 생성 모델, 편집 1위 | 오픈소스 영상 편집기 |
| VLA(비전-랭귀지-액션) | 시각·언어를 이해해 로봇 동작으로 연결하는 모델 | 눈·귀·손 통합 뇌 |
| 크리스퍼 위스퍼 2.0 | 오픈웨이트 고정확도 음성 인식(ASR) 모델 | 정확한 속기사 |
| 컨텍스트 엔지니어링 | 프롬프트를 삭감하고 모델 자율에 위임하는 설계 원칙 | 잔소리 줄이기 |
