AI NewsMORNING DIGEST · 2026-07-28 · AI News🎬 영상

Opus 5 BEATS Claude Fable 5 In Gaming, CAD, Robotics? (ANTHROPIC AI NEWS)

인포그래픽 요약

01핵심 개요

항목내용
채널AI News
제목Opus 5 BEATS Claude Fable 5 In Gaming, CAD, Robotics? (ANTHROPIC AI NEWS)
길이약 9분(556초)
핵심결론 1Anthropic은 최상위 Fable 5에 필적하는 지능을 절반 가격에 제공하는 Opus 5를 출시했으며(입력 100만 토큰당 5달러·출력 25달러), Claude Max 기본·Claude Pro 최강 모델로 채택됐다
핵심결론 2Opus 5는 역대 가장 정렬 상태가 양호한 모델(정렬 불량 점수 2.3)로 평가되나, 의도적으로 사이버 보안 역량은 Mythos 5보다 낮게 억제됐다
핵심결론 3Frontier Bench에서 Opus 4.8 점수를 두 배 이상 넘고, ARC AGI 3에서 차순위 모델의 3배, Cursor Bench 3.2에서 Fable 5 최고점과 0.5% 이내로 근접했다

02핵심 내용 구조

Opus 5의 위상과 가격

  • Opus 5는 Claude Max의 기본 모델이자 Claude Pro의 가장 강력한 모델로, 일상적 상시 사용을 위한 사려 깊고 능동적인 모델로 설계됐다.
  • 가격은 이전 Opus와 동일하게 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 Opus 4.8과 같다.
  • 그럼에도 Frontier Bench 0.1에서 Opus 4.8 점수를 두 배 이상 뛰어넘으면서 작업당 비용은 오히려 더 낮아졌다.

로봇·CAD 실사용 시연

  • 6자유도 로봇 팔로 제로샷 그릇 쌓기와 포크를 그릇에 꽂는 작업을 수행했고, 두 작업 모두 첫 시도에 성공했다.
  • LLM이 로봇 특화 모델이 아님에도 제로샷으로 성공했다는 점이 인상적인 대목으로 강조된다.
  • CAD·3D 작업에서도 성능을 보이며, 기계 부품 사진을 직접 못 보게 한 조건에서 자체 컴퓨터 비전 파이프라인을 구축해 형상을 추출·재구성했다.

벤치마크 성능 검증

  • Cursor Bench 3.2 최대 노력 실행 시 Opus 5는 Fable 5 최고점과 0.5% 이내 차이로, 절반 비용에 거의 동일한 결과를 냈다(플래그십 코딩 점수 99.12% 수준).
  • ARC AGI 3(암기로 못 푸는 신규 문제 해결 테스트)에서 차순위 모델보다 3배 높은 점수를, Zapier 자동화 벤치마크에서 동일 비용 대비 약 1.5배 통과율을 기록했다.
  • 사람처럼 컴퓨터를 조작하는 OSWorld 2.0에서 모든 가격대의 타 모델을 능가하며 Fable 5 최고 결과를 약 3분의 1 가격에 상회했다.

노력(effort) 설정 기능

  • 다이얼처럼 빠르고 저렴하게, 느리게, 최대로 조절하는 '노력 설정'이 새로 도입됐다.
  • Opus 5는 높음·매우 높음·최대 노력 등 모든 설정에서 경쟁 제품을 능가한다.
  • 가장 저렴한 노력 설정에서도 다른 모든 모델의 최고 결과를 능가하는 사례가 제시된다.

정렬·안전 평가

  • 사전 배포 테스트에서 자동화 행동 분석 결과 Opus 5는 역대 가장 정렬 상태가 양호한 모델로, Opus 4.8·Sonnet 5·Fable 5보다도 우수하고 기만적 행동 발생률이 가장 낮았다.
  • 전반적 정렬 불량 행동 점수에서 Opus 5는 2.3점으로 최근 모델 중 최저(가장 안전)를 기록했다.
  • 다만 정렬이 양호한 것과 해를 끼칠 가능성이 없는 것은 별개라는 단서를 붙인다.

무지시 실전 문제 3사례

  • 부품 재구성 사례에서 Opus 5는 여러 번 성공했으나 동일 조건의 다른 모델들은 5회 시도에도 한 번도 해결하지 못했다.
  • 인기 오픈소스 패키지 관리자의 실제 버그를 입력받자 표면 증상만 패치한 타 모델과 달리 실제 원인과 인간이 놓친 예외까지 수정했다.
  • 새 거래소 실시간 시장 데이터 피드를 단일 세션으로 구축하라는 과제에서, 테스트할 실시간 피드가 없자 스스로 자체 QA 테스트 환경을 만들어 파싱 정확성을 검증했다.

03기술적 맥락

  • 생명과학 평가에서 유기화학 작업은 Opus 4.8 대비 10.2%포인트, 단백질 서열 변이 기능 예측은 7.7%포인트 향상됐다.
  • OSS Fuzz 벤치마크에서 취약점 탐지 능력은 Mythos 5와 거의 대등했으나, 실제 취약점을 악용하는 능력은 의도적 미학습으로 훨씬 낮다.
  • 신규 베타로 프롬프트 캐시를 깨지 않는 대화 중간 도구 변경과, 플래그된 요청을 거부 대신 다른 모델로 자동 라우팅하는 자동 대체 기능이 추가됐다.

04전략적 의미

  • Fable 5급 성능을 절반 비용에 제공해 상시 고성능 사용의 경제성을 크게 끌어올린다.
  • 사이버 공격 역량을 의도적으로 억제한 것은 안전과 상용성을 동시에 잡으려는 Anthropic의 명확한 선긋기다.
  • 최고 정렬·최저 오용 가능성 지표는 기업 도입 시 리스크 관리 관점에서 강한 설득 포인트가 된다.

05핵심 워크플로우·방법론

  • 벤치마크 조작 우려를 감안해 코딩뿐 아니라 ARC AGI 3·Zapier·OSWorld 등 추론·에이전트 벤치마크로 교차 검증한다.
  • 무지시 상태로 복잡한 실전 문제에 투입해 모델의 자율적 문제 해결(자체 파이프라인·자체 QA 구축)을 관찰한다.
  • 노력 설정을 조절해 비용 대비 품질 트레이드오프를 작업별로 최적화한다.

06활용 시나리오

  • 로봇 팔 제어처럼 특화 훈련 없이 제로샷으로 물리 작업을 시도한다.
  • 사진 기반 기계 부품을 3D CAD 모델로 역설계·재구성한다.
  • 계획 문서 없이도 새 거래소용 실시간 데이터 피드와 자체 테스트 환경을 단일 세션으로 구축한다.

07현황 및 전망

  • Opus 5는 당일 모든 플랫폼에서 출시됐고 이전 Opus처럼 일반 액세스에 데이터 보존 요건이 없다.
  • 소스 코드 취약점 탐색은 허용되나 바이너리 스캔·침투 테스트·익스플로잇 생성은 차단되며, 검증된 연구자·기업은 사이버 검증 프로그램으로 확장 접근이 가능하다.
  • Opus 5의 사이버 분류기는 Fable 5보다 규제가 덜해 약 85% 더 낮은 빈도로 개입할 것으로 예상된다.

08용어 사전

용어한줄 설명비유·예시
Opus 5Fable 5급 지능을 절반 가격에 제공하는 Anthropic 신모델값은 반, 성능은 최상위
Fable 5Anthropic의 가장 비싸고 성능 높은 플래그십 모델최고가 프리미엄 라인
Mythos 5사이버 보안에서 가장 엄격히 관리되는 Anthropic 모델통제가 가장 센 전용 모델
ARC AGI 3암기로 못 푸는 신규 문제 해결력을 재는 벤치마크처음 보는 문제만 내는 시험
노력(effort) 설정속도·비용·품질을 다이얼처럼 조절하는 기능세기 조절 다이얼
AI News · 2026-07-28
← 목록으로