Nate Herk | AI AutomationYOUTUBE SUMMARIES · 2026-09-15 · Nate Herk | AI Automation🎬 영상
앤트로픽 전직·현직 연구자 발언이 AI 초지능 안전 경쟁 논쟁을 확산시켰다.
앤트로픽 관련 안전 경고와 초지능 개발 경쟁의 규제·공조 방안을 짚었다.
01핵심 개요
- 9월 8일 제이컵 콕슨은 앤트로픽을 퇴사하며 OpenAI와 앤트로픽이 자기개선 초지능 경쟁을 벌인다고 주장했다.
- 앤트로픽 정렬 과학 책임자 에번 허빙거는 AI가 향후 10년 내 인류를 죽일 확률을 10%보다 높게 본다고 밝혔다.
- 앤트로픽은 9월 10일 보고서에서 사이버 작전·사기 등 7개 위해 영역과 AI 에이전트의 해킹 실행 증가를 다뤘다.
- 다리오 아모데이는 상업·지정학적 인센티브가 안전을 약화시키는 '바닥을 향한 경쟁'을 만든다고 진단했다.
- 아모데이는 제3자 평가자, 민주적 조율, 국제 공조를 통해 AI 개발을 안전한 속도로 조정하자고 제안했다.
02핵심 주장 / 논점 구조
- 제이컵 콕슨의 퇴사 발언과 에번 허빙거의 위험 확률 언급이 AI 초지능 안전 논쟁의 출발점으로 제시됐다.
- 영상은 기업들이 성능 경쟁 때문에 안전 검증을 줄일 수 있다는 다리오 아모데이의 '바닥을 향한 경쟁' 논지를 중심으로 전개된다.
- 아모데이의 대안은 안전성과 거버넌스 기준에서도 기업이 경쟁하는 '정상을 향한 경쟁'을 만드는 것이다.
03제이컵 콕슨 퇴사 발언과 확산 경위
- 콕슨은 OpenAI와 앤트로픽에서 총 3년간 사전학습 연구를 했으며, 두 회사가 책임 있게 행동하지 않는다고 썼다.
- 그의 X 게시물은 월스트리트저널의 퇴사 관련 단독 보도 약 20분 뒤 게시됐고 빠르게 확산됐다고 영상은 설명했다.
- 콕슨의 계정은 이전 게시 활동이 없었고 짧은 기간 약 30만 팔로워를 얻은 점이 유기적 확산인지에 대한 의문으로 언급됐다.
04에번 허빙거의 10년 위험 확률 언급
- 앤트로픽 정렬 과학 책임자인 에번 허빙거는 콕슨의 주장에 동의하며 AI가 모든 인간을 죽일 수 있다고 썼다.
- 허빙거는 개인적으로 그 가능성이 향후 10년 안에 10%를 넘는다고 생각한다고 밝혔다.
- 그는 앤트로픽이 최선을 다하고 있다고 보면서도 초지능 정렬을 해결할 계획이 아직 없고, 해결 경로도 명확하지 않다고 말했다.
05앤트로픽 AI 오용 보고서의 사례
- 앤트로픽은 9월 10일 사이버 작전, 영향력 작전, 감시, 사기 등을 포함한 7개 위해 영역을 다룬 보고서를 냈다.
- 영상은 공격자들이 AI 에이전트로 사이버 작전을 실제 수행하는 비중이 커지고 있다는 보고서 내용을 강조했다.
- 한 데이팅 앱 작전에서는 약 5,000개의 AI 페르소나가 수만 명과 대화했으며, 뒤에는 사람이 있었다고 소개됐다.
06경쟁 모델 우회 사용 의혹과 업계 압력
- 앤트로픽은 알리바바의 무단 모델 학습 캠페인에 1억5,100만 건이 넘는 교환이 관련됐다고 귀속했다.
- 보고서는 문샷과 딥시크가 고객을 비밀리에 Claude로 라우팅했다는 의혹도 제기했다.
- 영상은 미국과 중국 모두 AI 선두를 원하고, 더 빠른 출시 경쟁이 검증과 안전 확보에 불리한 압력을 만든다고 설명했다.
07다리오 아모데이의 안전 경쟁 전환안
- 아모데이는 AI가 삶의 질을 크게 높일 수 있지만 강력한 기술인 만큼 위험도 매우 심각하다고 썼다.
- 그는 최전선 AI 기업에 지속적 직원급 접근 권한을 가진 제3자 내재형 평가자를 두는 방안을 제안했다.
- 또 민주적 조율과 국제 공조를 제시하며, 중국과의 협력이 필요하지만 지정학적 상황상 한계가 있을 수 있다고 언급했다.
08용어 사전
| 용어 | 뜻 |
|---|
| 초지능 정렬 | 초지능 AI가 인간의 의도와 안전 원칙에 맞게 행동하도록 만드는 문제로, 허빙거는 해결 계획이 없다고 밝혔다. |
| 바닥을 향한 경쟁 | 상업적·지정학적 승리 압력으로 기업들이 더 빠른 출시를 위해 안전 검증의 지름길을 택할 수 있다는 아모데이의 진단이다. |
| 정상을 향한 경쟁 | 모델 성능뿐 아니라 안전성 및 거버넌스 기준에서도 AI 기업들이 경쟁하도록 인센티브를 바꾸자는 구상이다. |
| 내재형 평가자 | 각 최전선 AI 기업의 안전 관행과 약속 이행을 점검하기 위해 지속적으로 접근하는 제3자 평가팀을 뜻한다. |
| AI 에이전트 | 앤트로픽의 오용 보고서 맥락에서 공격자들이 사이버 작전을 실행하는 데 활용하는 AI 시스템이다. |