
01핵심 개요
- 영상은 클로드 소넷 5.5의 성능과 안전성, 포의 인간 협업 방식, 그록봇·뮤즈·포의 에이전트 설계를 비교한다.
- 소넷 5.5는 터미널 벤치 4.5에서 70.6%를 기록해 오푸스 5.5의 66.4%를 앞섰지만, 작업당 출력 토큰 사용량은 약 19만 3천 개였다.
- 와조 AI가 공개한 자체 평가에서 포는 심부름을 71% 완료하고 함정 테스트에서 사용자 신뢰 94%를 유지했으며, 독립검증은 제한적이라고 설명한다.
- 그록봇은 역할별 봇과 팀 공유에, 메타의 뮤즈는 개인 목표 관리와 서비스 연동에, 포는 사람이 AI의 한계를 보완하는 방식에 초점을 둔다.
02핵심 주장 / 논점 구조
- 영상은 클로드 소넷 5.5의 벤치마크·비용·안전성을 살펴본 뒤, 포의 인간 협업 방식과 세 에이전트의 차이를 비교한다.
- 소넷 5.5는 에이전틱 코딩과 실무 작업에서 강점을 보이지만, 높은 토큰 사용량과 지식 정확도는 함께 고려해야 한다고 제시한다.
- 에이전트 비교의 핵심은 그록봇의 업무 팀원, 뮤즈의 개인생활 관리, 포의 인간 개입이라는 서로 다른 설계 방향이다.
03소넷 5.5의 벤치마크와 실무 성능
- 터미널 벤치 4.5에서 소넷 5.5는 70.6%를 기록해 소넷 5의 10.3%, 오푸스 5.5의 66.4%보다 높았다.
- 커서 벤치 4.5는 55.5%로 오푸스 5.5의 57.8%에 조금 못 미쳤고, 프론티어 코드 1.1도 52.1%로 오푸스의 54.4%보다 낮았다.
- GDPval Elo는 1844로 오푸스 5.5의 1846과 비슷했고, 휴머니티스 라스트 엑삼은 도구 사용 시 64.5%를 기록했다.
- OS월드 2.1은 80.1%로 소넷 5의 57%보다 높았으며, 차트 인식 평가는 61.6%로 소넷 5의 15.6%에서 상승했다.
04토큰 비용과 안전성 평가
- Artificial Analysis의 인텔리전스 인덱스에서 맥스 에포트 기준 56점을 받았고, 오푸스 5.5 맥스보다 2점 낮았다고 소개한다.
- 해당 평가에서 작업당 출력 토큰은 약 19만 3천 개였으며 작업당 비용은 7.60달러로, 소넷 5보다 약 50% 비쌌다고 설명한다.
- AA 옴니사이언스 점수는 54%로 오푸스 5.5의 66%보다 낮았지만, 환각률은 47%로 오푸스의 59%보다 낮았다고 제시한다.
- 시스템 카드에서는 미스얼라인먼트 위험을 낮게 평가했고, 프롬프트 인젝션 방어력이 소넷 클래스 중 가장 강하다고 밝혔다고 전한다.
- 사이버 능력이 오푸스 5 수준으로 올라 오푸스급 사이버 제한을 적용했다고 설명한다.
05포의 인간 협업 방식과 자체 평가
- 와조 AI의 포는 AI가 처리하지 못하는 작업을 실제 사람에게 넘기고, 인간이 작업을 완료하는 방식을 학습하는 에이전트로 소개된다.
- 와조 팀 자체 평가에서 포는 실제 심부름을 혼자 71% 완료했고, 함정 테스트에서 사용자 신뢰율 94%와 실수율 6%를 기록했다.
- 비교 대상 베이스 모델의 완료율은 50~64%, 신뢰율은 59~75%였고, 오픈클로는 완료율 42%, 신뢰율 74%, 실수율 32%로 제시됐다.
- 포는 자체 이메일 주소·전화번호·음성·신용카드를 사용해 이메일, 채팅, 브라우저, 전화에서 예약·구매·파일 작성 등을 수행한다고 설명한다.
- 평가는 실제 계정과 합성 웹사이트, 시뮬레이션 통화자를 활용하며, 영상은 수치가 자체 평가이고 독립검증은 제한적이라고 덧붙인다.
06그록봇과 뮤즈의 기능 및 설계
- 그록봇은 8월 베타 출시 후 9월 28일 팀 봇 기능을 추가했으며, 팀이 공유하는 역할별 봇과 각 봇의 클라우드 컴퓨터를 활용한다고 설명한다.
- 영업·운영·엔지니어링·인박스 봇을 병렬로 운영하고 봇끼리 작업을 넘기는 구조가 그록봇의 업무 자동화 방향으로 제시된다.
- 뮤즈는 메타가 9월 8일 미국 소비자 대상으로 출시한 에이전트로, 하나의 대화에서 장기 목표를 관리하고 백그라운드 작업을 수행한다고 소개된다.
- 뮤즈는 뮤즈 시큐어 VM에서 실행되고 센티널이 외부 출력을 승인하며, 왓츠앱·인스타그램·페이스북 연동 기능을 제공한다고 설명한다.
- 영상은 뮤즈의 무료 티어와 월 20달러 파워, 월 100달러 맥시멈 요금제를 언급하고, 미국 전용과 메타에 데이터를 맡기는 점을 약점으로 든다.
07세 에이전트의 역할과 한계 비교
- 그록봇은 팀 업무의 병렬 처리와 역할 분담에, 뮤즈는 개인 목표 관리와 소비자 서비스 연동에, 포는 인간 개입을 통한 작업 완료와 신뢰에 초점을 둔다.
- 그록봇은 무료 티어가 없고 개인생활 관리보다 업무 자동화에 맞춰져 있다고 설명하며, 뮤즈는 접근성과 메타 서비스 생태계 연동을 강점으로 제시한다.
- 포는 자체 평가에서 완료율과 신뢰율이 높게 나타났지만, 인간 투입 비용의 장기적 영향은 불확실하다고 영상은 지적한다.
- 세 제품의 비교는 에이전트가 단순히 모델 역량을 키우는 것뿐 아니라, 업무 분담·서비스 연결·사람의 도움으로 신뢰를 설계할 수 있음을 보여준다.
08용어 사전
| 용어 | 뜻 |
|---|
| 적응형 추론 | 영상에서 소넷 5.5가 제공하는 기능으로, 로우부터 맥스까지 다섯 단계의 에포트 설정과 함께 언급된다. |
| 인텔리전스 인덱스 | Artificial Analysis의 모델 평가 지표로, 소넷 5.5는 맥스 에포트에서 56점을 받았다고 소개된다. |
| 프롬프트 인젝션 | 외부 입력을 이용해 에이전트의 동작에 영향을 주려는 공격으로, 소넷 5.5의 방어력이 강하다고 설명된다. |
| 뮤즈 시큐어 VM | 뮤즈가 실행되는 자체 클라우드 가상 머신으로, 별도 가드 에이전트인 센티널과 함께 언급된다. |
| 인간 개입형 에이전트 | 포처럼 AI가 처리하지 못하는 작업을 사람에게 맡겨 완료율과 신뢰를 높이려는 설계 방식이다. |