
01핵심 개요
- Opus 5.5는 Fable 5.1과 같은 수준으로 작동하면서 비용은 40% 낮다고 소개됐으며, 여러 벤치마크에서 우위를 보였다.
- 비즈니스 워크플로와 에이전트형 과학 연구만 GPT6 Astra에 각각 1.4%, 약 6% 뒤졌다고 설명했다.
- Terminal Bench 4.0의 high 설정에서 Opus 5.5는 64.2%, 작업당 3.88달러로 제시됐다.
- 입력·출력 100만 토큰 가격은 각각 4달러·20달러이며, Astra와 Fable 5.1은 10달러·50달러다.
- 고노력 설정일수록 비용 대비 성능의 수확 체감이 나타났고, medium이 max보다 나은 Frontier Code 결과도 언급됐다.
02핵심 주장 / 논점 구조
- 영상은 Opus 5.5가 Fable 5.1급 성능을 제공하면서 40% 저렴하다는 Anthropic의 주장을 중심으로 전개한다.
- 비교 대상은 Fable 5.1, Opus 5, GPT6 Astra, 5.6 Soul이며, 벤치마크·작업 비용·사용성·안전성을 함께 다뤘다.
- 전반적 벤치마크 우위와 토큰 가격만으로 실제 성능을 단정할 수 없으며, 실제 사용을 통한 검증이 필요하다고 했다.
03벤치마크별 경쟁 모델 비교
- Opus 5.5는 제시된 벤치마크 전반에서 대부분 모델을 앞섰고, GPT6 Astra에 뒤진 항목은 두 곳뿐이라고 말했다.
- 비즈니스 워크플로 벤치마크에서는 GPT6 Astra보다 1.4% 낮고, 에이전트형 과학 연구에서는 약 6% 낮다고 설명했다.
- Fable 5.1과 비교하면 Opus 5.5는 거의 모든 항목에서 앞섰으며, Opus 5 대비 특히 코딩 관련 성과가 크게 뛰었다고 했다.
04Terminal Bench 4.0의 성능과 작업 비용
- Terminal Bench 4.0 그래프에서 Opus 5.5는 빨간색, Fable 5.1은 초록색, Astra는 회색으로 표시됐다고 설명했다.
- Opus 5.5는 high·extra high·max에서 특히 높은 성능을 보였고, high 설정은 64.2%와 3.88달러로 제시됐다.
- Astra의 high 작업 비용은 7.21달러로 언급됐고, Fable 5.1 high는 49.4%·10.50달러로 비교됐다.
- 영상은 100만 토큰당 가격보다 실제 작업 완성에 쓰는 토큰량과 작업당 비용을 함께 봐야 한다고 강조했다.
05노력 설정별 수확 체감 현상
- Terminal Bench 4.0에서 high의 64.2%와 extra high의 64.8%는 차이가 작지만, 비용은 거의 4배라고 설명했다.
- Cursor Bench에서도 high 설정이 훨씬 낮은 비용으로 max에 가까운 결과를 낸다는 동일한 경향이 언급됐다.
- Frontier Code에서는 medium이 54.6%로 max의 54.4%보다 높았고, 비용은 6~7배 저렴하다고 했다.
- 영상은 Opus 5.5 medium이 모든 모델을 앞서면서 다른 모델의 low 설정보다도 저렴하다고 평가했다.
06토큰 가격과 지식 업무 벤치마크
- Opus 5.5의 100만 토큰당 가격은 입력 4달러, 출력 20달러이며 Opus 5보다도 저렴하다고 소개됐다.
- 캐시 읽기와 쓰기 비용도 더 낮아졌다고 했으며, Astra와 Fable 5.1은 입력 10달러·출력 50달러로 비교됐다.
- 지식 업무 벤치마크에서도 유사한 우위가 이어졌으나, Automation Bench에서는 Astra가 앞섰다고 설명했다.
- 제시된 벤치마크를 그대로 받아들인다면 Opus 5.5는 매우 효율적인 모델이라는 결론을 제시했다.
07대화 품질 개선과 안전장치
- Opus 5는 전문 용어와 특이한 표현이 많아 이해하기 어려웠고, 이른바 ‘Opus slop’ 밈도 있었다고 언급했다.
- Anthropic은 Opus 5.5가 전문 용어와 특이한 문구를 덜 쓰며, 사용자가 준 글쓰기 규칙을 따른다고 밝혔다.
- 사이버 보안이나 생물학 질문을 부정적 용도로 판단하면 질문을 Opus 4.8로 리라우팅하며, Fable 5.1과 유사한 방식이라고 했다.
- API 사용자가 Claude의 이전 맥락을 수정해 추론을 추출하려는 증류 공격도 막는다고 설명했다.
- 출시 범위와 실제 사용 기대: Opus 5.5는 영상 공개 시점에 모든 곳에서 이용 가능하다고 소개됐다.
- 출시 범위와 실제 사용 기대: 최근 일주일가량 Opus가 조용히 Opus 5.5로 라우팅됐을 때의 출력이 트위터에서 인상적이었다는 반응을 전했다.
- 출시 범위와 실제 사용 기대: 영상 화자는 Anthropic 플랜에서 Fable의 주간 사용량 절반만 쓸 수 있어, 나머지 절반에 Opus 5.5를 쓰는 점을 기대했다.
- 출시 범위와 실제 사용 기대: 사용량 제한이 없는 Astra를 위해 ChatGPT로 옮기는 선택지도 언급했지만, 이는 200달러 플랜을 쓸 수 있을 때라고 덧붙였다.
08용어 사전
| 용어 | 뜻 |
|---|
| Opus 5.5 | Fable 5.1급 성능과 40% 낮은 비용을 표방하며, 코딩·지식 업무 벤치마크와 사용성 개선이 소개된 모델이다. |
| Terminal Bench 4.0 | 모델별 노력 설정에 따른 성능과 작업당 비용을 Opus 5.5, Fable 5.1, Astra로 비교한 벤치마크다. |
| Frontier Code | 코딩 성능 비교에 사용된 벤치마크로, Opus 5.5 medium이 54.6%를 기록했다고 언급됐다. |
| 노력 설정 | medium, high, extra high, max처럼 모델의 작업 수준을 나눈 설정이며 높은 설정에서 비용 대비 수확 체감이 관찰됐다. |
| 리라우팅 | 사이버 보안·생물학 관련 질문을 부정적 사용으로 판단할 경우 Opus 5.5의 요청을 Opus 4.8로 보내는 처리다. |