Matt WolfeMORNING DIGEST · 2026-09-05 · Matt Wolfe🎬 영상
한 주 만에 4개 SOTA 모델 출격, 벤치마크 신뢰도 흔들리다
Matt Wolfe가 Fable 5.1·Gemini 3.8 Flash·Muse Spark·GPT6를 실사용 테스트로 교차검증한 주간 브리핑.

01핵심 개요
- 4대 랩(Anthropic, Google, Meta, OpenAI)이 한 주 동안 나란히 신모델 출시, 역대급 밀집 발표 주간.
- Fable 5.1은 벤치마크 1위지만 작업당 $3.69로 최고가, Megabonk 게임 클론에 $120 이상 소모.
- Gemini 3.8 Flash는 Deep SWE 73.7%를 작업당 $2.36에 달성해 가성비 1위로 부상.
- Muse Spark 1.3은 Deep SWE·Artificial Analysis 상위권이지만 실제 코딩 결과물은 가장 단순.
- GPT6 Astra는 ARC-AGI-3에서 99.9%를 기록하며 해당 벤치마크를 사실상 무력화.
02핵심 주장 / 논점 구조
- Matt Wolfe의 핵심 논지: "벤치마크 순위와 실사용 체감이 갈수록 어긋난다."
- Muse Spark 1.3이 Deep SWE 75.4%로 1위권인데 공식 리더보드에는 아예 등재되지 않는 모순 발견.
- 동일한 Megabonk 클론 프롬프트로 4개 모델을 나란히 실행해 비주얼 완성도를 직접 비교하는 방법론 채택.
- Beauty Bench(AI 심사 기반 SVG 생성 평가)는 "참고용일 뿐 직접 눈으로 판단해야 한다"고 재차 강조.
- 결론적으로 저자는 "이제 가장 좋아하던 Artificial Analysis 벤치마크조차 완전히 신뢰하기 어렵다"고 선언.
034개 모델 정면 비교
| 모델 | Deep SWE | 작업당 비용 | Beauty Bench 순위 | 비고 |
|---|
| Claude Fable 5.1 | 70% | $3.69 | 2위 ($4.35, 18분) | Fable 5 대비 25% 저렴 주장, 실측은 최고가 |
| Gemini 3.8 Flash | 73.7% | $2.36 | 공동 3위 (9센트, 1분32초) | 코딩 가성비 최강 |
| Muse Spark 1.3 | 75.4%(리더보드 미등재) | $0.55 | 20위 (1분4초, 무료) | 벤치마크·실사용 괴리 최대 |
| GPT6 Astra | 74.1% | 약 $1.94(추정) | 1위 (9분) | ARC-AGI-3 99.9%로 벤치마크 포화 |
04Megabonk 클론 실사용 테스트
- Fable 5.1: 캐릭터·색감은 우수하나 호버 시 깜빡임 등 잔버그, 생성에 2시간 소요.
- Anthropic 20x 플랜($200/월) 크레딧을 전부 소진하고 추가 과금까지 발생해 총 $120 이상 지출.
- Gemini 3.8 Flash(Cursor 경유): 캐릭터가 여우보다 마법사에 가깝지만 전반적 완성도는 Fable 5 초기 결과보다 우수, 크레딧 소모 미미.
- Muse Spark 1.3: 큐브와 실린더 수준의 매우 단순한 결과물 — 코딩 벤치마크 1위와 정면 배치.
- GPT6 Astra: 기사·궁수·마법사 3종 캐릭터, 스켈레톤·박쥐 등 디테일 우수, 12분 만에 생성되어 시각적으로 가장 완성도 높은 게임으로 평가.
05전략적 의미
- 벤치마크 점수만으로 모델을 선택하면 실제 비용·품질 면에서 오판할 위험이 커지고 있음을 시사.
- 코딩·에이전트 워크로드에서는 "최고 성능"보다 "성능 대비 비용"이 실질적 채택 기준으로 부상(Gemini 3.8 Flash 사례).
- Nvidia의 Hugging Face 인수는 프론티어 랩들이 자체 칩 개발에 나서는 상황에서 오픈웨이트 모델·온프레미스 컴퓨팅 수요에 베팅하는 전략으로 해석됨.
- ChatGPT 대화가 법정 증거로 채택될 수 있다는 사실은 기업·개인 사용자의 프라이버시 기대치를 재점검하게 만드는 규제 리스크.
06활용 시나리오
- 대규모 코딩 에이전트 작업: Gemini 3.8 Flash처럼 벤치마크 상위권이면서 비용이 낮은 모델을 우선 검토.
- 이미지·영상 기반 신규 서비스: World Labs Atlas로 소수의 사진만으로 3D 공간을 재구성해 인테리어·부동산·게임 프리비주얼 제작에 활용 가능.
- 반복적 콘텐츠 파이프라인: Art List AI Flows의 노드 기반 워크플로우로 이미지·영상·보이스오버 모델을 한 번 구성해 재사용.
- 고비용 예산이 있는 디자인 작업에서만 Fable 5.1급 최상위 모델을 선별적으로 투입해 비용 리스크를 관리.
07현황 및 전망
- GPT6 Astra는 현재 일부 조직 대상 제한 공개 단계이며, 향후 ChatGPT Plus/Pro/비즈니스/엔터프라이즈로 순차 확대 예정.
- Runway Solaris(Gen 4.5 기반 실시간 인터랙티브 영상 편집), World Labs Atlas 모두 얼리 액세스 단계로 아직 일반 공개 전.
- AI 영상 슬롭 스트리밍(Fal.Live, InfiniteSlop.ai)이 피크 시청자 3만7천명을 기록하며 새로운 소비 형태로 확산 중.
- 9월 한 달간 MetaConnect, Apple 이벤트, OpenAI Dev Day, Made on YouTube 등 대형 행사가 연이어 예정되어 "테크텀버(Techtember)"로 불리는 발표 러시가 지속될 전망.
08용어 사전
- Deep SWE: 코딩 실무 체감과 상관관계가 높다고 평가받는 소프트웨어 엔지니어링 벤치마크.
- Beauty Bench: AI가 SVG 이미지를 얼마나 미려하게 코드로 생성하는지 AI 심사로 평가하는 벤치마크.
- ARC-AGI: 추상적 추론 능력을 측정하는 벤치마크 시리즈로, 3번째 버전(ARC-AGI-3)까지 출시.
- 오픈웨이트 모델: 가중치를 공개해 로컬 실행이 가능한 모델로, Hugging Face가 대표적 배포 허브 역할을 함.
- AI 슬롭(AI Slop): 품질보다 물량 위주로 생성되는 저품질·과잉 생성 AI 콘텐츠를 가리키는 속어.
- Gaussian Splat: 다수의 사진으로 3D 장면을 점 구름 형태로 재구성하는 기존 기법으로, Atlas와 비교 대상으로 언급됨.