저자 주장: 벤치마크 수치만으로는 판단 불가 — "Deep Sweep 1.1에서 74.1점이라고 7.5% 더 낫다는 뜻은 아니다"
Anthropic은 벤치마크 공개 항목이 OpenAI보다 훨씬 적어 비교 자체가 불리한 구조
성능이 비슷해도 토큰 비용에서 GPT-6가 압도적으로 저렴해 실사용 가치는 Astra 쪽에 기움
그럼에도 "두 모델 다 훌륭하다"는 균형 잡힌 결론 — 저자는 Fable 5.1을 최근 3일간 실사용하며 부족함을 못 느꼈다고 함
03벤치마크 해석: 숫자가 말해주지 않는 것
GPT-6는 OpenAI 발표 자료 기준 거의 모든 공개 지표에서 Fable 5.1을 상회
단, Gemini 3.8 Flash가 GPT-6를 제외한 나머지 모델보다 특정 벤치마크에서 앞서는 사례가 있어 "벤치마크는 진공 상태에서 보면 안 된다"고 경고
5.6 대비 GPT-6는 "스텝 체인지"급 도약으로 평가되는 반면, Fable 5.1은 Fable 5 대비 "이미 좋았던 것을 더 잘하는" 점진적 개선으로 규정
비용 축을 함께 보면 Astra가 동일 성능을 더 싸게 낸다는 점이 실질적 차별점
044개 실사용 테스트 상세
포트나이트 클론(원샷+레퍼런스 이미지): Codex는 배틀버스, 글라이더, 인벤토리 전환, 건물 건설까지 매끄럽게 구현. Fable 5.1은 카메라가 janky하고 총알 탄착점과 조준점이 어긋나는 블룸 문제, 나무 채집 애니메이션 부자연스러움 등으로 완성도 열세 — "경쟁이 안 된다"는 평가
AI 여행 랜딩페이지: GPT-6는 내장 이미지 생성 모델로 자체 이미지를 만들어 넣어 "AI 슬롭처럼 안 보이는" 깔끔한 결과물 산출. Fable 5.1은 연한 파랑→진한 파랑 그라디언트의 기본적인 히어로 섹션에 모션이 거의 없어 저자가 "실망스럽다"고 평가하며 이례적으로 Anthropic 우위 통념을 뒤집음
모션그래픽(Higgsfield MCP 연동, 15초 설명 애니메이션): 두 모델 다 외부 툴 호출과 프롬프트 라우팅을 잘 처리해 무승부로 평가된 유일한 항목
3D 글로브 여행 대시보드: GPT-6의 "Orbit"은 출발/도착지 선택, 실시간 정보(예: 뉴욕→케이프타운 22시간·1스톱·$864, 19도), "Chase the Sun" 골든아워 기능까지 포함해 깔끔하고 실용적. Fable 5.1의 "Arclight"는 시각적으로 화려하지만 과도한 밝기와 정보 밀도로 가독성이 떨어져 저자가 "여러 번 더 프롬프트를 줘야 실사용 가능한 수준"이라 평가
05전략적 의미
프론트엔드 디자인에서 Anthropic 모델이 우위라는 기존 통념이 이번 원샷 테스트에서는 뒤집힘 — 모델 세대교체 시점마다 재검증이 필요함을 시사
토큰 비용 격차(약 2배)는 에이전틱 장시간 작업(게임 개발, 복잡한 웹앱)일수록 누적되어 실질 ROI에 큰 영향을 미침
"숙련자에게는 모델 선택이 덜 중요하다"는 지적 — 레퍼런스 이미지·컴포넌트 라이브러리 활용 능력이 모델 격차를 상쇄할 수 있음을 시사
Anthropic의 사용량 정책(20x가 실제 20배가 아님, 주간 한도 50%만 제공)에 대한 신뢰 저하가 모델 성능과 별개로 이탈 요인으로 작용 중
06핵심 워크플로우 또는 비교표
항목
GPT-6 Astra (Codex)
Claude Fable 5.1
Terminal Bench 2.0 최고 정확도
56.7%
55.8%
동일 조건 비용(최대)
$10.35
$19.50
포트나이트 클론 소요시간
약 45분
약 1시간 30분(75만 토큰)
포트나이트 클론 완성도
매끄러운 건플레이·건설
카메라 janky, 총기 블룸 부정확
랜딩페이지 디자인
자체 이미지 생성, 깔끔
기본 그라디언트, 모션 부족
모션그래픽(Higgsfield MCP)
우수
우수 (무승부)
3D 대시보드
실용적·깔끔(Orbit)
화려하지만 과잉(Arclight)
사용량 정책
3일마다 리셋(일부 축소)
주간 20x가 실질 20배 아님
종합 스코어
3승 1무
0승 1무
07활용 시나리오
짧은 원샷 프롬프트로 빠르게 프로토타입(게임, 랜딩페이지)을 검증해야 하는 개발자는 Astra/Codex가 시간·비용 면에서 유리
모션그래픽처럼 외부 MCP 툴(Higgsfield 등)을 호출하는 워크플로우는 두 모델 모두 안정적으로 활용 가능
시각적 임팩트가 최우선인 데모·피칭 자료 제작에는 Fable 5.1의 화려한 스타일이 오히려 강점이 될 수 있으나, 실사용 대시보드는 정보 위계 정리 작업이 추가로 필요
예산이 유동적인 팀은 Astra와 Fable 5.1을 각각 5x 플랜으로 병행 구독($200/월 수준)해 프로젝트별로 선택하는 전략이 합리적
08현황 및 전망
GPT-6 Astra는 영상 공개 시점(2026-09-05) 기준 얼리 액세스 단계였으며, 이후 전체 사용자 대상 순차 출시(rolling out)가 시작될 예정이라고 저자가 언급
Anthropic은 최근 한 달간 사용량 제한을 낮췄다가 이를 "상향"으로 포장했다는 비판이 커뮤니티에서 제기되는 상황이며, 이는 모델 성능과 무관하게 사용자 이탈 압력으로 작용
저자는 "5.6이 Fable 5와 경쟁 가능하다"던 소수 의견이 있었음을 언급하며, 이번 GPT-6 출시로 그 격차 논쟁이 다시 부상했다고 평가
향후 관전 포인트는 벤치마크 격차 축소 여부보다 토큰 비용 효율과 사용량 정책의 신뢰도가 실사용자 선택을 좌우할 가능성이 크다는 점
09용어 사전
GPT-6 Astra: OpenAI가 출시한 최신 플래그십 모델(코드네임 Astra), 자체 이미지 생성 모델 내장
Claude Fable 5.1: Anthropic이 출시한 최신 모델, Fable 5 대비 점진적 개선판
Codex: OpenAI의 에이전틱 코딩 플랫폼/데스크톱 도구, 본 영상에서 GPT-6 Astra 실행 환경으로 사용
Terminal Bench 2.0: 터미널 기반 에이전틱 작업 수행 능력을 측정하는 벤치마크
Deep Sweep v1.1: 영상에서 언급된 벤치마크 중 하나로 모델 간 점수 비교에 사용
Higgsfield MCP: 모션그래픽 생성을 위해 두 모델이 공통으로 호출한 외부 MCP(Model Context Protocol) 툴
20x 플랜: Anthropic의 상위 구독 플랜 명칭으로, 실제 제공 사용량이 표기된 배수에 못 미친다는 논란의 대상