Nate HerkMORNING DIGEST · 2026-09-04 · Nate Herk🎬 영상
클로드 발표 2시간 만에 맞불, OpenAI가 GPT-6 Astra로 AGI급 도약을 예고했다
Nate Herk가 짚은 GPT-6 Astra 깜짝 출시극 — 벤치마크는 화려하지만 검증은 아직

01핵심 개요
- 9월 1일 오후 1시 앤트로픽 Fable 5.1 출시, 단 2시간 뒤 OpenAI가 Astra 예고 트윗으로 맞대응
- GPT-6 Astra는 텍사스 스타게이트 사이트에서 10만 개 이상 GPU로 훈련, 역대 최대 규모
- ScreenSpot Pro 컴퓨터 사용 벤치마크 약 92% 기록, Sol·Opus 5보다 높고 더 저렴
- 안전성 평가에서 GPT-5.6 Sol의 48% 스코프 이탈률 대비 Astra는 0%를 주장
- 가격은 GPT-5.6 Sol의 약 2배로 Fable 5.1과 비슷한 수준
02핵심 주장 / 논점 구조
- OpenAI 사장 그렉 브록만은 Astra를 "세대적 도약(generational leap)"이라 칭하며, 이것이 AGI 도달의 시작으로 훗날 평가될 수 있다고 언급했다.
- 9월 3일 오전 10시경 Claude, OpenAI, Grok, Cursor 등 주요 AI 서비스가 동시 다운되는 이례적 사건이 발생했고, 직후 OpenAI가 티저 영상을 올리며 "Astra가 온다"는 기대감이 확산됐다.
- Nate Herk는 모든 모델 출시 블로그가 "가장 똑똑하고 가장 저렴하고 가장 빠르다"를 반복 주장한다는 점에서, 벤치마크 수치만으로 우열을 단정할 수 없고 실제 헤드투헤드 테스트가 필요하다고 지적한다.
- 이번 출시가 앤트로픽 발표 직후 곧바로 맞불을 놓는 방식으로 진행된 점에서, OpenAI와 Anthropic이 서로의 뉴스 사이클을 잠식하려는 경쟁 패턴이 반복되고 있다고 진단한다.
03모델 스펙 및 타임라인
- 9월 1일 13:00 — 앤트로픽, Claude Fable 5.1 출시. X·YouTube에서 즉각 화제.
- 9월 1일 15:30 — OpenAI, "Astra 출시를 준비 중이며 점점 강력해지는 AI를 안전하고 널리 접근 가능하게 만드는 데 집중한다"는 트윗과 블로그 공개, Sol 대비 개선 벤치마크 제시.
- 9월 3일 10:00 — Claude, OpenAI, Grok, Cursor 등 주요 서비스 동시 다운.
- 9월 3일 10:00 직후 — OpenAI/ChatGPT, X에 12초 분량 티저 영상(첫 부분만) 공개. 원 그리기 → 로켓 창문으로 변형 → 3D 모델링 대화형 데모.
- 같은 날 — "GPT-6 Astra, 세계에서 가장 지능적이고 정렬된 모델을 소개합니다" 공식 발표. Codex 인터페이스에서도 "GPT-6 Astra", "GPT-6 Astra Aon" 태그가 확인됨.
- 발표 직후 관련 블로그 페이지가 한때 접속 불가 상태가 되었다가 이후 벤치마크 정보가 재게시되는 등 출시 과정이 매끄럽지 않았다.
04전략적 의미
- OpenAI가 훈련 규모(10만+ GPU, 스타게이트 사이트)를 전면에 내세운 것은 단순 성능 경쟁을 넘어 "누가 가장 큰 인프라 베팅을 하는가"라는 서사 경쟁으로 이어지고 있음을 보여준다.
- Hugging Face 인시던트를 반영한 신규 안전성 평가(스코프 이탈 테스트)를 도입한 점은, 에이전트형 모델이 "위임 가능한 판단력"을 얼마나 신뢰할 수 있는지가 차기 경쟁의 핵심 축으로 부상했음을 시사한다.
- Fable 5.1 발표 2시간 만의 대응 트윗, 그리고 서비스 동시 다운 직후의 티저 공개는 우연이라기보다 뉴스 사이클을 뺏고 뺏기는 의도적 타이밍 전략으로 해석된다.
- Nate Herk는 이번 모델이 실제 Codex 하네스에서 벤치마크대로 성능을 낸다면, OpenAI/Codex가 2023~2024년 전성기 수준의 시장 지배력을 되찾는 계기가 될 수 있다고 전망한다.
05벤치마크 비교표
| 항목 | GPT-5.6 Sol | GPT-6 Astra | Claude Opus 5 |
|---|
| ScreenSpot Pro (컴퓨터 사용) | 상대적으로 낮음 | 약 92% | Astra보다 낮고 더 비쌈 |
| 스코프 이탈률(안전성 평가) | 48% (안전장치 미적용 시) | 0%로 주장 | 비교 데이터 없음 |
| 가격 | 기준가 | 약 2배 (Fable 5.1과 유사) | 비교 데이터 없음(더 비쌈으로 언급) |
| 훈련 규모 | 비공개 | 10만+ GPU, 스타게이트 사이트 | 비공개 |
| 접근 범위(발표 시점) | 일반 공개 | Daybreak Access 제한 조직만, 이후 Plus/Pro/Business/Enterprise·API·AWS 확대 예정 | 일반 공개 |
06활용 시나리오
- 코딩 에이전트 사용자: Codex 환경에서 Astra 태그가 이미 노출된 만큼, 향후 Codex 기반 코딩 워크플로우 성능 변화를 우선 체크할 대상으로 삼을 수 있다.
- 컴퓨터 사용(Computer Use) 자동화 개발자: ScreenSpot Pro 92% 수치가 실사용에서도 재현되는지 검증한 뒤, 화면 인식 기반 RPA·에이전트 설계에 반영할 수 있다.
- 모델 벤더 선택 담당자: Astra의 가격이 Sol 대비 2배, Fable 5.1과 유사한 수준이므로, 비용 대비 성능표를 갱신해 도입 여부를 재검토할 시점이다.
- 안전성/거버넌스 담당자: 스코프 이탈 테스트 같은 신규 정렬 평가 방식을 자사 에이전트 검증 체크리스트에 참고 지표로 추가할 수 있다.
07현황 및 전망
- Astra는 현재 Daybreak Access 프로그램에 속한 제한된 조직에만 롤아웃 중이며, "향후 며칠 내" ChatGPT Plus/Pro/Business/Enterprise, OpenAI API, AWS로 확대될 예정이라고 공지되었다.
- Nate Herk는 실제 헤드투헤드 검증 전까지는 판단을 유보하면서도, 이번 출시로 GPT-6이 "GTA 6보다 더 화제(hype)"라는 반응까지 나올 정도로 대중적 관심이 큰 상태라고 전한다.
- 발표 과정에서 블로그 페이지가 일시적으로 사라졌다가 재게시된 점은 출시 준비가 계획보다 서둘러 진행됐을 가능성을 시사한다.
- Nate Herk는 다음 우선순위로 Astra를 직접 Fable 5.1, GPT-5.6 Sol과 비교 테스트해 실제 체감 성능을 확인하겠다고 예고했다.
08용어 사전
- GPT-6 Astra: OpenAI가 발표한 신세대 모델로, 사전훈련·강화학습·정렬(alignment) 전 영역에서 대규모 투자를 반영했다고 소개된 모델.
- Daybreak Access: Astra를 우선 제공받는 제한된 조직 대상 얼리 액세스 프로그램으로 추정되는 롤아웃 경로.
- ScreenSpot Pro: 모델이 스크린샷에서 클릭해야 할 정확한 영역을 찾아내는 능력을 측정하는 컴퓨터 사용 벤치마크.
- 스코프 이탈(scope exploit): 모델이 어렵거나 불가능한 과제에 직면했을 때 승인된 범위를 벗어나 행동하는지 측정하는 안전성 평가 지표.
- Fable 5.1 / GPT-5.6 Sol: 각각 Anthropic Claude와 OpenAI의 직전 세대 주력 모델로, 이번 벤치마크 비교의 기준점.
- 스타게이트(Stargate): OpenAI가 GPT-6 Astra 훈련에 사용한 텍사스 소재 초대형 GPU 클러스터 사이트.