Nate Herk | AI AutomationYOUTUBE SUMMARIES · 2026-09-15 · Nate Herk | AI Automation🎬 영상

앤트로픽 전직·현직 연구자 발언이 AI 초지능 안전 경쟁 논쟁을 확산시켰다.

앤트로픽 관련 안전 경고와 초지능 개발 경쟁의 규제·공조 방안을 짚었다.

01핵심 개요

  • 9월 8일 제이컵 콕슨은 앤트로픽을 퇴사하며 OpenAI와 앤트로픽이 자기개선 초지능 경쟁을 벌인다고 주장했다.
  • 앤트로픽 정렬 과학 책임자 에번 허빙거는 AI가 향후 10년 내 인류를 죽일 확률을 10%보다 높게 본다고 밝혔다.
  • 앤트로픽은 9월 10일 보고서에서 사이버 작전·사기 등 7개 위해 영역과 AI 에이전트의 해킹 실행 증가를 다뤘다.
  • 다리오 아모데이는 상업·지정학적 인센티브가 안전을 약화시키는 '바닥을 향한 경쟁'을 만든다고 진단했다.
  • 아모데이는 제3자 평가자, 민주적 조율, 국제 공조를 통해 AI 개발을 안전한 속도로 조정하자고 제안했다.

02핵심 주장 / 논점 구조

  • 제이컵 콕슨의 퇴사 발언과 에번 허빙거의 위험 확률 언급이 AI 초지능 안전 논쟁의 출발점으로 제시됐다.
  • 영상은 기업들이 성능 경쟁 때문에 안전 검증을 줄일 수 있다는 다리오 아모데이의 '바닥을 향한 경쟁' 논지를 중심으로 전개된다.
  • 아모데이의 대안은 안전성과 거버넌스 기준에서도 기업이 경쟁하는 '정상을 향한 경쟁'을 만드는 것이다.

03제이컵 콕슨 퇴사 발언과 확산 경위

  • 콕슨은 OpenAI와 앤트로픽에서 총 3년간 사전학습 연구를 했으며, 두 회사가 책임 있게 행동하지 않는다고 썼다.
  • 그의 X 게시물은 월스트리트저널의 퇴사 관련 단독 보도 약 20분 뒤 게시됐고 빠르게 확산됐다고 영상은 설명했다.
  • 콕슨의 계정은 이전 게시 활동이 없었고 짧은 기간 약 30만 팔로워를 얻은 점이 유기적 확산인지에 대한 의문으로 언급됐다.

04에번 허빙거의 10년 위험 확률 언급

  • 앤트로픽 정렬 과학 책임자인 에번 허빙거는 콕슨의 주장에 동의하며 AI가 모든 인간을 죽일 수 있다고 썼다.
  • 허빙거는 개인적으로 그 가능성이 향후 10년 안에 10%를 넘는다고 생각한다고 밝혔다.
  • 그는 앤트로픽이 최선을 다하고 있다고 보면서도 초지능 정렬을 해결할 계획이 아직 없고, 해결 경로도 명확하지 않다고 말했다.

05앤트로픽 AI 오용 보고서의 사례

  • 앤트로픽은 9월 10일 사이버 작전, 영향력 작전, 감시, 사기 등을 포함한 7개 위해 영역을 다룬 보고서를 냈다.
  • 영상은 공격자들이 AI 에이전트로 사이버 작전을 실제 수행하는 비중이 커지고 있다는 보고서 내용을 강조했다.
  • 한 데이팅 앱 작전에서는 약 5,000개의 AI 페르소나가 수만 명과 대화했으며, 뒤에는 사람이 있었다고 소개됐다.

06경쟁 모델 우회 사용 의혹과 업계 압력

  • 앤트로픽은 알리바바의 무단 모델 학습 캠페인에 1억5,100만 건이 넘는 교환이 관련됐다고 귀속했다.
  • 보고서는 문샷과 딥시크가 고객을 비밀리에 Claude로 라우팅했다는 의혹도 제기했다.
  • 영상은 미국과 중국 모두 AI 선두를 원하고, 더 빠른 출시 경쟁이 검증과 안전 확보에 불리한 압력을 만든다고 설명했다.

07다리오 아모데이의 안전 경쟁 전환안

  • 아모데이는 AI가 삶의 질을 크게 높일 수 있지만 강력한 기술인 만큼 위험도 매우 심각하다고 썼다.
  • 그는 최전선 AI 기업에 지속적 직원급 접근 권한을 가진 제3자 내재형 평가자를 두는 방안을 제안했다.
  • 또 민주적 조율과 국제 공조를 제시하며, 중국과의 협력이 필요하지만 지정학적 상황상 한계가 있을 수 있다고 언급했다.

08용어 사전

용어뜻
초지능 정렬초지능 AI가 인간의 의도와 안전 원칙에 맞게 행동하도록 만드는 문제로, 허빙거는 해결 계획이 없다고 밝혔다.
바닥을 향한 경쟁상업적·지정학적 승리 압력으로 기업들이 더 빠른 출시를 위해 안전 검증의 지름길을 택할 수 있다는 아모데이의 진단이다.
정상을 향한 경쟁모델 성능뿐 아니라 안전성 및 거버넌스 기준에서도 AI 기업들이 경쟁하도록 인센티브를 바꾸자는 구상이다.
내재형 평가자각 최전선 AI 기업의 안전 관행과 약속 이행을 점검하기 위해 지속적으로 접근하는 제3자 평가팀을 뜻한다.
AI 에이전트앤트로픽의 오용 보고서 맥락에서 공격자들이 사이버 작전을 실행하는 데 활용하는 AI 시스템이다.
Nate Herk | AI Automation · 2026-09-15
← 목록으로