평범한 사업가YOUTUBE SUMMARIES · 2026-10-03 · 평범한 사업가🎬 영상

그록봇·뮤즈·포는 업무 자동화·개인 비서·인간 협업으로 에이전트의 서로 다른 방향을 보여준다.

소넷 5.5의 성능과 포·그록봇·뮤즈의 서로 다른 에이전트 설계를 비교한다.

인포그래픽 요약

01핵심 개요

  • 영상은 클로드 소넷 5.5의 성능과 안전성, 포의 인간 협업 방식, 그록봇·뮤즈·포의 에이전트 설계를 비교한다.
  • 소넷 5.5는 터미널 벤치 4.5에서 70.6%를 기록해 오푸스 5.5의 66.4%를 앞섰지만, 작업당 출력 토큰 사용량은 약 19만 3천 개였다.
  • 와조 AI가 공개한 자체 평가에서 포는 심부름을 71% 완료하고 함정 테스트에서 사용자 신뢰 94%를 유지했으며, 독립검증은 제한적이라고 설명한다.
  • 그록봇은 역할별 봇과 팀 공유에, 메타의 뮤즈는 개인 목표 관리와 서비스 연동에, 포는 사람이 AI의 한계를 보완하는 방식에 초점을 둔다.

02핵심 주장 / 논점 구조

  • 영상은 클로드 소넷 5.5의 벤치마크·비용·안전성을 살펴본 뒤, 포의 인간 협업 방식과 세 에이전트의 차이를 비교한다.
  • 소넷 5.5는 에이전틱 코딩과 실무 작업에서 강점을 보이지만, 높은 토큰 사용량과 지식 정확도는 함께 고려해야 한다고 제시한다.
  • 에이전트 비교의 핵심은 그록봇의 업무 팀원, 뮤즈의 개인생활 관리, 포의 인간 개입이라는 서로 다른 설계 방향이다.

03소넷 5.5의 벤치마크와 실무 성능

  • 터미널 벤치 4.5에서 소넷 5.5는 70.6%를 기록해 소넷 5의 10.3%, 오푸스 5.5의 66.4%보다 높았다.
  • 커서 벤치 4.5는 55.5%로 오푸스 5.5의 57.8%에 조금 못 미쳤고, 프론티어 코드 1.1도 52.1%로 오푸스의 54.4%보다 낮았다.
  • GDPval Elo는 1844로 오푸스 5.5의 1846과 비슷했고, 휴머니티스 라스트 엑삼은 도구 사용 시 64.5%를 기록했다.
  • OS월드 2.1은 80.1%로 소넷 5의 57%보다 높았으며, 차트 인식 평가는 61.6%로 소넷 5의 15.6%에서 상승했다.

04토큰 비용과 안전성 평가

  • Artificial Analysis의 인텔리전스 인덱스에서 맥스 에포트 기준 56점을 받았고, 오푸스 5.5 맥스보다 2점 낮았다고 소개한다.
  • 해당 평가에서 작업당 출력 토큰은 약 19만 3천 개였으며 작업당 비용은 7.60달러로, 소넷 5보다 약 50% 비쌌다고 설명한다.
  • AA 옴니사이언스 점수는 54%로 오푸스 5.5의 66%보다 낮았지만, 환각률은 47%로 오푸스의 59%보다 낮았다고 제시한다.
  • 시스템 카드에서는 미스얼라인먼트 위험을 낮게 평가했고, 프롬프트 인젝션 방어력이 소넷 클래스 중 가장 강하다고 밝혔다고 전한다.
  • 사이버 능력이 오푸스 5 수준으로 올라 오푸스급 사이버 제한을 적용했다고 설명한다.

05포의 인간 협업 방식과 자체 평가

  • 와조 AI의 포는 AI가 처리하지 못하는 작업을 실제 사람에게 넘기고, 인간이 작업을 완료하는 방식을 학습하는 에이전트로 소개된다.
  • 와조 팀 자체 평가에서 포는 실제 심부름을 혼자 71% 완료했고, 함정 테스트에서 사용자 신뢰율 94%와 실수율 6%를 기록했다.
  • 비교 대상 베이스 모델의 완료율은 50~64%, 신뢰율은 59~75%였고, 오픈클로는 완료율 42%, 신뢰율 74%, 실수율 32%로 제시됐다.
  • 포는 자체 이메일 주소·전화번호·음성·신용카드를 사용해 이메일, 채팅, 브라우저, 전화에서 예약·구매·파일 작성 등을 수행한다고 설명한다.
  • 평가는 실제 계정과 합성 웹사이트, 시뮬레이션 통화자를 활용하며, 영상은 수치가 자체 평가이고 독립검증은 제한적이라고 덧붙인다.

06그록봇과 뮤즈의 기능 및 설계

  • 그록봇은 8월 베타 출시 후 9월 28일 팀 봇 기능을 추가했으며, 팀이 공유하는 역할별 봇과 각 봇의 클라우드 컴퓨터를 활용한다고 설명한다.
  • 영업·운영·엔지니어링·인박스 봇을 병렬로 운영하고 봇끼리 작업을 넘기는 구조가 그록봇의 업무 자동화 방향으로 제시된다.
  • 뮤즈는 메타가 9월 8일 미국 소비자 대상으로 출시한 에이전트로, 하나의 대화에서 장기 목표를 관리하고 백그라운드 작업을 수행한다고 소개된다.
  • 뮤즈는 뮤즈 시큐어 VM에서 실행되고 센티널이 외부 출력을 승인하며, 왓츠앱·인스타그램·페이스북 연동 기능을 제공한다고 설명한다.
  • 영상은 뮤즈의 무료 티어와 월 20달러 파워, 월 100달러 맥시멈 요금제를 언급하고, 미국 전용과 메타에 데이터를 맡기는 점을 약점으로 든다.

07세 에이전트의 역할과 한계 비교

  • 그록봇은 팀 업무의 병렬 처리와 역할 분담에, 뮤즈는 개인 목표 관리와 소비자 서비스 연동에, 포는 인간 개입을 통한 작업 완료와 신뢰에 초점을 둔다.
  • 그록봇은 무료 티어가 없고 개인생활 관리보다 업무 자동화에 맞춰져 있다고 설명하며, 뮤즈는 접근성과 메타 서비스 생태계 연동을 강점으로 제시한다.
  • 포는 자체 평가에서 완료율과 신뢰율이 높게 나타났지만, 인간 투입 비용의 장기적 영향은 불확실하다고 영상은 지적한다.
  • 세 제품의 비교는 에이전트가 단순히 모델 역량을 키우는 것뿐 아니라, 업무 분담·서비스 연결·사람의 도움으로 신뢰를 설계할 수 있음을 보여준다.

08용어 사전

용어뜻
적응형 추론영상에서 소넷 5.5가 제공하는 기능으로, 로우부터 맥스까지 다섯 단계의 에포트 설정과 함께 언급된다.
인텔리전스 인덱스Artificial Analysis의 모델 평가 지표로, 소넷 5.5는 맥스 에포트에서 56점을 받았다고 소개된다.
프롬프트 인젝션외부 입력을 이용해 에이전트의 동작에 영향을 주려는 공격으로, 소넷 5.5의 방어력이 강하다고 설명된다.
뮤즈 시큐어 VM뮤즈가 실행되는 자체 클라우드 가상 머신으로, 별도 가드 에이전트인 센티널과 함께 언급된다.
인간 개입형 에이전트포처럼 AI가 처리하지 못하는 작업을 사람에게 맡겨 완료율과 신뢰를 높이려는 설계 방식이다.
평범한 사업가 · 2026-10-03
← 목록으로