조코딩MORNING DIGEST · 2026-09-07 · 조코딩🎬 영상

GPT-6 아스트라가 아크AGI3 99.9점을 찍으며 AI 모델 경쟁이 격변했다

조코딩이 정리한 이번 주 AI 뉴스: 아스트라·페이블 5.1·제미나이 3.8·뮤즈 스파크·아틀라스까지 격전

인포그래픽 요약

01핵심 개요

  • 오픈AI GPT-6 아스트라, 아크AGI3 99.9점·수능 450점 만점 달성
  • 앤트로픽 페이블 5.1, 아티피셜 아날리시스 종합 1위(57점)지만 체감은 아스트라 우세
  • 구글 제미나이 3.8 플래시, 딥소프트웨어엔지니어링 74%로 아스트라·오퍼스5와 동급
  • 메타 뮤즈 스파크 1.3·월드랩스 아틀라스 등 오픈 웨이트·3D 월드 모델 경쟁 가세
  • 미니맥스 H3 영상 생성 1.4초/5초로 가속, 실시간 인터랙션 영상까지 등장

02핵심 주장 / 논점 구조

  • 프론티어 모델 경쟁이 "벤치마크 1위"보다 "실사용 체감"으로 무게중심이 이동 중
  • 오픈AI가 컴퓨터 사용(computer use)·에이전틱 실행력에서 앤트로픽을 앞섰다는 평가 확산
  • 오픈 웨이트·중국 모델(큐원, 쇼피파이 파인튜닝 사례)이 저비용으로 프론티어를 빠르게 추격
  • 광고 수익화(챗GPT 애즈 연 매출 10억 달러)와 저작권 공정사용 판단 등 정책·수익 이슈도 병행
  • 영상 생성 속도 혁신(H3)이 실시간 게임·인터랙티브 콘텐츠 가능성을 여는 변곡점으로 제시됨

03GPT-6 아스트라: 컴퓨터 사용과 벤치마크의 동시 도약

  • 아크AGI3 벤치마크 하네스 적용 시 99.9점(비적용 시 약 60점대)으로 사실상 정복, GPT-5.6 솔은 7.8점에 그쳤던 항목에서 압도
  • 2026년 한국 수능 450점 만점 최초 달성(GPT-5.6 솔은 448.5점으로 만점 실패)
  • 코드 아레나 1위(1797점, 페이블 5.1은 1762점)이며 API 비용은 태스크당 2.57달러로 페이블 5.1(6.12달러)의 절반 이하
  • 컴퓨터 사용 데모: 피아노 연주, 캔바 손그림·선그림, 구글 슬라이드/캘린더 조작, 파이널컷 실시간 편집, 픽셀 아트 직접 타이핑 등
  • 블렌더 결합 시 45분 만에 원샷으로 3D 게임 제작(고도 엔진 기준 맥스 설정 53분·주간 사용량 4%, 미디엄 설정 25분·1%), 사실적 박쥐 모델링에서 이전 솔 버전 대비 정교함 대폭 향상
  • 언리얼 엔진 안에 아스트라 기반 에이전트들이 생존을 위해 협력·대화하는 시뮬레이션 세계를 구현한 영상이 조회수 천만 회 돌파
  • 구글이 9월 3일 공개한 수컷 초파리 전체 신경 지도(약 11,700개 뉴런 시각화, 총 166,700개 뉴런)를 아스트라 도움으로 마인크래프트에 그대로 구현해 실제 생물 행동과 유사하게 동작시킨 사례 화제

04오픈AI 생태계 확장: 광고 수익화와 정책 순풍

  • 챗GPT 애즈(광고) 서비스가 연 매출 10억 달러를 돌파, 글로벌 확장 지속 중
  • 앤트로픽이 과거 슈퍼볼 광고에서 "우리는 광고하지 않는다"고 선언했던 것과 대비되며, 조코딩은 향후 앤트로픽도 광고 도입 가능성을 언급
  • 미국 법무부가 오픈AI 저작권 소송에서 "저작권 텍스트로 LLM을 훈련하는 것은 일반적으로 공정 사용으로 인정되어야 한다"는 이해관계 성명서 제출(뉴욕타임즈 보도)
  • 코덱스에 여러 Gmail·구글 캘린더 계정 연결 기능 추가, 챗GPT 웹 회의 녹음·요약 기능(코덱스 미팅 플러그인), 사용자 말투를 학습하는 라이팅 스타일 기능 테스트 중
  • 런챗GPT닷컴 트레이닝 사이트에서 공식 사용법 강의 공개(영어 자막만 지원)

05앤트로픽 페이블 5.1·미소스 5.1: 1위 벤치마크지만 체감 논란

  • 페이블(Fable) 5.1과 보안 필터가 완화된 미소스(Miso) 5.1을 동시 공개, 이전 페이블 5 대비 여러 방면에서 큰 폭 개선
  • 아티피셜 아날리시스 인덱스 기준 57점으로 GPT-6 아스트라(2점 차)를 제치고 종합 1위
  • 다만 벤치마크 점수가 사후 보정되어 상향된 점, 실제 체감상 컴퓨터 사용·블렌더 작업에서 아스트라에 뒤처진다는 사용자 반응이 논란으로 제기됨
  • 클로드 "맥스 20배" 플랜 표기 논란: 200달러 플랜의 "20배"는 5시간 사용 구간에만 적용되고 전체 사용량 기준으로는 그에 못 미침. 반면 코덱스의 20배 플랜은 전체 사용량 기준으로 정확히 20배를 제공한다는 비교가 확산되며 개발자 신뢰가 코덱스 쪽으로 다소 기우는 분위기
  • 클로드도 컴퓨터 사용(코워크·클로드 코드 내 컴퓨터 제어) 기능을 출시했으나, 캔바 그림 비교 데모에서 아스트라 대비 디테일·정교함이 낮다는 평가

06구글 제미나이 3.8 플래시와 신규 라인업

  • 제미나이 3.8 플래시 및 보안 특화 버전 3.8 플래시 사이버 공개, 가격은 이전 3.7 플래시와 동일 유지
  • 딥소프트웨어엔지니어링 벤치마크 74%로 GPT-6 아스트라·클로드 오퍼스 5와 동급 수준 도달, 플래시(경량) 모델임에도 가성비 최상위권
  • 구글 픽스: 프롬프트로 디자인 생성 후 특정 요소만 클릭해 개별 편집·번역·팀 협업이 가능한 디자인 툴(워크스페이스·AI 프로/울트라 구독자 대상)
  • 음악 생성 모델 리라(Lyria) 3.5 공개, AI 스튜디오·제미나이 API·앱에서 사용 가능, 표현력 있는 보컬과 편곡 지원(실제 K-pop 스타일 데모에서는 아직 발음 부자연스러움 존재)
  • 신규 에이전틱 비디오 이해 API: 영상 이해 시 토큰을 최대 88% 절감(테스트에서 26% 절감 확인), 제미나이 데스크탑 앱에 에스크·어사이 모드 및 컴퓨터 사용 기능 추가 예정
  • 웨더넥스트 3: 이전 대비 5배 선명한 5km 해상도 기상 예측 모델, 구글 지도·클라우드 전반에 통합

07메타·마이크로소프트·오픈 웨이트 진영의 추격

  • 메타 뮤즈 스파크(Muse Spark) 1.3: 긴 에이전트 작업의 코딩 효율 개선, 아티피셜 아날리시스 지수에서 GPT-5.6 솔보다 2점 높은 점수, 가격은 태스크당 0.96달러로 저렴
  • 메타 뮤즈 보이스 트랜스크라이브: 실시간 음성 인식·화자 분리 모델, 워드 에러율 비교에서 일레븐랩스 스크라이브 V2·GPT·제미나이 3.5 트랜스크라이브보다 우수
  • 마이크로소프트 MAI 트랜스크라이브 2(속도·정확도 개선)와 MAI 이미지 2.6(GPT 이미지 2 능가, 1천 장 생성에 50달러 미만) 공개
  • 메타 Air3 연구 시스템이 엔비디아 대회에서 30B 네모트론 모델 파인튜닝으로 4,000개 팀 중 8위·금메달 획득, AI 자율 연구의 실용성 입증
  • 쇼피파이 ML팀이 파인튜닝한 0.8B 소형 모델(큐원 3.5 기반)이 GPT-5.6 솔 X하이를 능가, 특정 작업에서 소형 모델의 경쟁력 입증
  • 알리바바 큐원(Qwen) 3.8맥스 공개(API 전용, 오픈 웨이트 아님), 이전 버전 대비 점수 대폭 상승
  • 미국 기업(AT&T, 에어비앤비, 딜로이트 등)의 오픈 웨이트 모델 도입 확산, AT&T는 AI 비용 최대 80% 절감. 오픈라우터 기준 오픈 모델 API 사용 비중이 1년 전 10%에서 지난달 58%로 급증

08영상·3D 생성 혁신: 미니맥스 H3와 월드랩스 아틀라스

  • 미니맥스 H3, 5초 영상을 1.4초 만에 생성(실시간 팩터 약 0.28배)하며 "생성이 시청보다 빠른" 특이점 도달
  • 비글 애니메이트: H3 기반으로 재제작되어 오픈 웨이트로 공개(허깅페이스 배포), 사람·동물 댄스 모션 복제 기능 지속
  • H3월드: H3를 세계 모델로 전환, 키보드 입력으로 캐릭터를 실시간 조작할 수 있는 8K 샘플 월드 모델, 오픈 웨이트 공개
  • 실시간 음성 명령("텔레포트 SF", "마추픽추로 텔레포트")으로 즉시 장면이 전환되는 실시간 인터랙티브 영상 데모 공개
  • 그록(xAI) 이매진 비디오 1.5 에이전트: 최신 이미지 2.0 모델 기반, 인물 사진과 웹 검색 자료를 조합해 브이로그 영상 자동 생성(단, 얼굴 왜곡 등 완성도 이슈 존재)
  • 월드랩스(피포이 리 교수 참여) 아틀라스: 사진 한두 장으로 픽셀 단위 카메라 제어가 가능한 3D 공간을 재구성하는 멀티모달 월드 모델, 로봇 시뮬레이션 등에 활용 가능

09전략적 의미

  • 컴퓨터 사용·에이전틱 실행력이 벤치마크 점수를 넘어서는 실질적 경쟁 축으로 부상하면서, "종합 1위" 타이틀보다 실제 작업 완결도가 시장 평가를 좌우하는 흐름이 뚜렷해짐
  • 가격 대비 성능 경쟁이 격화되며(아스트라 2.57달러 vs 페이블 5.1 6.12달러, 오픈 웨이트 20% 가격 수준) 소비자에게는 선택지가 넓어지는 반면 프론티어 랩들의 수익 압박은 커짐
  • 광고 수익화·저작권 공정사용 판단 등 정책·비즈니스 이슈가 모델 성능 경쟁과 함께 본격적으로 부상하며 AI 업계의 수익 모델 다각화가 가속
  • 영상 생성 속도의 비약적 향상(H3)은 게임·인터랙티브 콘텐츠 제작 방식 자체를 바꿀 잠재력을 보유

10핵심 워크플로우 또는 비교표

모델/제품출시사주요 기능특징(수치)
GPT-6 아스트라오픈AI컴퓨터 사용, 코딩, 3D/블렌더 연동아크AGI3 99.9점, 수능 450점 만점, 코드아레나 1797점, 2.57달러/태스크
페이블 5.1 / 미소스 5.1앤트로픽범용 추론, 안전 필터 차등화아티피셜 아날리시스 57점(1위), 6.12달러/태스크
제미나이 3.8 플래시 / 사이버구글경량 고성능, 보안 특화딥소프트웨어엔지니어링 74%, 오퍼스5·아스트라와 동급
뮤즈 스파크 1.3메타긴 에이전트 작업 코딩 효율GPT-5.6 솔보다 2점 높음, 0.96달러/태스크
큐원 3.8맥스알리바바범용 LLM(API 전용)이전 버전 대비 점수 대폭 상승, 오픈웨이트 아님
미니맥스 H3미니맥스초고속 영상 생성5초 영상 1.4초 생성(실시간 팩터 0.28)
아틀라스월드랩스사진 기반 3D 월드 재구성사진 1~2장으로 픽셀 단위 카메라 제어 3D 공간 생성
MAI 이미지 2.6마이크로소프트이미지 생성GPT 이미지 2 능가, 1천장/50달러 미만

11활용 시나리오

  • 게임/3D 콘텐츠 제작자: 아스트라+블렌더 조합으로 원샷 3D 게임 프로토타입 제작, H3월드로 실시간 조작 가능한 월드 데모 구축
  • 개발팀: 코드 아레나 1위·저비용인 아스트라를 웹 개발 기본값으로, 코덱스의 정확한 20배 플랜 정책을 사용량 예측에 반영
  • 마케팅/브랜드팀: 구글 픽스로 요소 단위 편집이 가능한 광고 디자인 제작, 버셀식 디자인.md 템플릿으로 코딩 에이전트의 브랜드 일관성 확보
  • 스타트업/1인 창업자: 쇼피파이 사례처럼 소형 파인튜닝 모델로 특정 작업 비용 절감, 소상공인 지식배움터 전자도서관으로 학습 비용 절감
  • 영상 제작자: 미니맥스 H3 기반 실시간 AI 인플루언서 방송, 그록 이매진으로 자동 브이로그 초안 생성 후 수작업 보정

12현황 및 전망

  • 오픈AI가 컴퓨터 사용·에이전틱 실행력에서 앞서가며 개발자 커뮤니티의 무게중심이 코덱스 쪽으로 이동하는 조짐이 뚜렷해짐
  • 앤트로픽은 벤치마크 종합 1위를 유지하고 있으나 실사용 체감 격차와 가격 논란으로 방어전 양상
  • 구글은 제미나이 3.8 플래시로 가성비 경쟁력을 확보했고, 픽스·리라·웨더넥스트 등 주변 제품군을 빠르게 확장 중
  • 메타·마이크로소프트·알리바바 등은 오픈 웨이트·저비용 모델로 프론티어를 빠르게 추격하며, 기업들의 오픈소스 AI 채택 비중이 급증(58%)하는 추세가 가격 경쟁을 심화시킬 전망
  • 영상 생성은 H3를 기점으로 "생성이 시청보다 빠른" 단계에 진입, 실시간 인터랙티브 게임·콘텐츠로의 확장이 다음 경쟁 축이 될 것으로 예상

13용어 사전

  • 아크AGI3(ARC-AGI-3): 인간에게는 쉽지만 AI에게는 어려운 새로운 패턴의 퍼즐로 범용 추론 능력을 측정하는 벤치마크
  • 컴퓨터 사용(Computer Use): AI가 마우스 클릭·키보드 입력 등으로 실제 컴퓨터 화면을 직접 조작하는 기능
  • 코드 아레나: 사용자 투표 기반으로 AI가 생성한 웹 개발 결과물의 우열을 가리는 순위 플랫폼
  • 아티피셜 아날리시스(Artificial Analysis): 여러 벤치마크를 종합한 AI 모델 성능 지수를 제공하는 평가 기관
  • 오픈 웨이트(Open Weight): 모델 가중치를 공개해 누구나 다운로드·로컬 구동할 수 있게 한 배포 방식
  • 월드 모델(World Model): 이미지·영상 등을 기반으로 탐험 가능한 3D 또는 인터랙티브 가상 공간을 생성하는 AI 모델
  • 실시간 팩터(Real-time Factor): 영상 생성 속도를 실제 재생 시간과 비교한 지표(1.0 미만이면 재생보다 빠르게 생성)
조코딩 · 2026-09-07
← 목록으로