
01핵심 개요
| 항목 | 내용 |
|---|
| 채널 | AI News |
| 제목 | Opus 5 BEATS Claude Fable 5 In Gaming, CAD, Robotics? (ANTHROPIC AI NEWS) |
| 길이 | 약 9분(556초) |
| 핵심결론 1 | Anthropic은 최상위 Fable 5에 필적하는 지능을 절반 가격에 제공하는 Opus 5를 출시했으며(입력 100만 토큰당 5달러·출력 25달러), Claude Max 기본·Claude Pro 최강 모델로 채택됐다 |
| 핵심결론 2 | Opus 5는 역대 가장 정렬 상태가 양호한 모델(정렬 불량 점수 2.3)로 평가되나, 의도적으로 사이버 보안 역량은 Mythos 5보다 낮게 억제됐다 |
| 핵심결론 3 | Frontier Bench에서 Opus 4.8 점수를 두 배 이상 넘고, ARC AGI 3에서 차순위 모델의 3배, Cursor Bench 3.2에서 Fable 5 최고점과 0.5% 이내로 근접했다 |
02핵심 내용 구조
Opus 5의 위상과 가격
- Opus 5는 Claude Max의 기본 모델이자 Claude Pro의 가장 강력한 모델로, 일상적 상시 사용을 위한 사려 깊고 능동적인 모델로 설계됐다.
- 가격은 이전 Opus와 동일하게 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 Opus 4.8과 같다.
- 그럼에도 Frontier Bench 0.1에서 Opus 4.8 점수를 두 배 이상 뛰어넘으면서 작업당 비용은 오히려 더 낮아졌다.
로봇·CAD 실사용 시연
- 6자유도 로봇 팔로 제로샷 그릇 쌓기와 포크를 그릇에 꽂는 작업을 수행했고, 두 작업 모두 첫 시도에 성공했다.
- LLM이 로봇 특화 모델이 아님에도 제로샷으로 성공했다는 점이 인상적인 대목으로 강조된다.
- CAD·3D 작업에서도 성능을 보이며, 기계 부품 사진을 직접 못 보게 한 조건에서 자체 컴퓨터 비전 파이프라인을 구축해 형상을 추출·재구성했다.
벤치마크 성능 검증
- Cursor Bench 3.2 최대 노력 실행 시 Opus 5는 Fable 5 최고점과 0.5% 이내 차이로, 절반 비용에 거의 동일한 결과를 냈다(플래그십 코딩 점수 99.12% 수준).
- ARC AGI 3(암기로 못 푸는 신규 문제 해결 테스트)에서 차순위 모델보다 3배 높은 점수를, Zapier 자동화 벤치마크에서 동일 비용 대비 약 1.5배 통과율을 기록했다.
- 사람처럼 컴퓨터를 조작하는 OSWorld 2.0에서 모든 가격대의 타 모델을 능가하며 Fable 5 최고 결과를 약 3분의 1 가격에 상회했다.
노력(effort) 설정 기능
- 다이얼처럼 빠르고 저렴하게, 느리게, 최대로 조절하는 '노력 설정'이 새로 도입됐다.
- Opus 5는 높음·매우 높음·최대 노력 등 모든 설정에서 경쟁 제품을 능가한다.
- 가장 저렴한 노력 설정에서도 다른 모든 모델의 최고 결과를 능가하는 사례가 제시된다.
정렬·안전 평가
- 사전 배포 테스트에서 자동화 행동 분석 결과 Opus 5는 역대 가장 정렬 상태가 양호한 모델로, Opus 4.8·Sonnet 5·Fable 5보다도 우수하고 기만적 행동 발생률이 가장 낮았다.
- 전반적 정렬 불량 행동 점수에서 Opus 5는 2.3점으로 최근 모델 중 최저(가장 안전)를 기록했다.
- 다만 정렬이 양호한 것과 해를 끼칠 가능성이 없는 것은 별개라는 단서를 붙인다.
무지시 실전 문제 3사례
- 부품 재구성 사례에서 Opus 5는 여러 번 성공했으나 동일 조건의 다른 모델들은 5회 시도에도 한 번도 해결하지 못했다.
- 인기 오픈소스 패키지 관리자의 실제 버그를 입력받자 표면 증상만 패치한 타 모델과 달리 실제 원인과 인간이 놓친 예외까지 수정했다.
- 새 거래소 실시간 시장 데이터 피드를 단일 세션으로 구축하라는 과제에서, 테스트할 실시간 피드가 없자 스스로 자체 QA 테스트 환경을 만들어 파싱 정확성을 검증했다.
03기술적 맥락
- 생명과학 평가에서 유기화학 작업은 Opus 4.8 대비 10.2%포인트, 단백질 서열 변이 기능 예측은 7.7%포인트 향상됐다.
- OSS Fuzz 벤치마크에서 취약점 탐지 능력은 Mythos 5와 거의 대등했으나, 실제 취약점을 악용하는 능력은 의도적 미학습으로 훨씬 낮다.
- 신규 베타로 프롬프트 캐시를 깨지 않는 대화 중간 도구 변경과, 플래그된 요청을 거부 대신 다른 모델로 자동 라우팅하는 자동 대체 기능이 추가됐다.
04전략적 의미
- Fable 5급 성능을 절반 비용에 제공해 상시 고성능 사용의 경제성을 크게 끌어올린다.
- 사이버 공격 역량을 의도적으로 억제한 것은 안전과 상용성을 동시에 잡으려는 Anthropic의 명확한 선긋기다.
- 최고 정렬·최저 오용 가능성 지표는 기업 도입 시 리스크 관리 관점에서 강한 설득 포인트가 된다.
05핵심 워크플로우·방법론
- 벤치마크 조작 우려를 감안해 코딩뿐 아니라 ARC AGI 3·Zapier·OSWorld 등 추론·에이전트 벤치마크로 교차 검증한다.
- 무지시 상태로 복잡한 실전 문제에 투입해 모델의 자율적 문제 해결(자체 파이프라인·자체 QA 구축)을 관찰한다.
- 노력 설정을 조절해 비용 대비 품질 트레이드오프를 작업별로 최적화한다.
06활용 시나리오
- 로봇 팔 제어처럼 특화 훈련 없이 제로샷으로 물리 작업을 시도한다.
- 사진 기반 기계 부품을 3D CAD 모델로 역설계·재구성한다.
- 계획 문서 없이도 새 거래소용 실시간 데이터 피드와 자체 테스트 환경을 단일 세션으로 구축한다.
07현황 및 전망
- Opus 5는 당일 모든 플랫폼에서 출시됐고 이전 Opus처럼 일반 액세스에 데이터 보존 요건이 없다.
- 소스 코드 취약점 탐색은 허용되나 바이너리 스캔·침투 테스트·익스플로잇 생성은 차단되며, 검증된 연구자·기업은 사이버 검증 프로그램으로 확장 접근이 가능하다.
- Opus 5의 사이버 분류기는 Fable 5보다 규제가 덜해 약 85% 더 낮은 빈도로 개입할 것으로 예상된다.
08용어 사전
| 용어 | 한줄 설명 | 비유·예시 |
|---|
| Opus 5 | Fable 5급 지능을 절반 가격에 제공하는 Anthropic 신모델 | 값은 반, 성능은 최상위 |
| Fable 5 | Anthropic의 가장 비싸고 성능 높은 플래그십 모델 | 최고가 프리미엄 라인 |
| Mythos 5 | 사이버 보안에서 가장 엄격히 관리되는 Anthropic 모델 | 통제가 가장 센 전용 모델 |
| ARC AGI 3 | 암기로 못 푸는 신규 문제 해결력을 재는 벤치마크 | 처음 보는 문제만 내는 시험 |
| 노력(effort) 설정 | 속도·비용·품질을 다이얼처럼 조절하는 기능 | 세기 조절 다이얼 |