01핵심 개요
- 타입세이프 AI의 디오고 알메이다는 제브를 채팅 모델이 아니라 프로그램 안에서 판단을 수행하는 자동화용 부품으로 소개했다.
- 발표 기준 제브 가격은 입력 100만 토큰당 0.042달러이며, 출력은 무료라고 설명됐다.
- 제브는 구조화된 질문 묶음에 약 100밀리초로 응답해 초당 약 10번 판단하며 둠 플레이를 시연했다.
- 위키 레이스 시연에서 제브는 0.4초와 0.047센트로 도착했지만, 비교 대상은 대부분 추론을 끈 모델이었다.
- 영상은 ‘환각 0%’가 실측 오류율이 아니라 정해진 출력 형식을 보장한다는 뜻이라며 검증 필요성을 강조했다.
02핵심 주장 / 논점 구조
- 제브의 핵심은 문장을 생성하는 대화형 AI보다 코드 안에서 빠른 판단을 반복하는 데 있다는 주장이다.
- 문의 내용을 결제팀 또는 기술팀으로 보내는 것처럼 정해진 선택지 가운데 결정을 내리는 활용 사례를 제시했다.
- 발표는 빠르고 저렴한 판단의 자동화 가능성을 강조했지만, 영상은 만능 AI나 오류 없는 판단기는 아니라고 정리했다.
- 작은 분류 업무부터 정확도와 비용을 함께 측정한 뒤 제브의 가치를 판단해야 한다고 권고했다.
03시스템 원과 RLHF 비판
- 디오고 알메이다는 오픈AI에서 챗GPT와 RLHF를 공동 개발했다고 자신을 소개했다.
- 그는 RLHF가 AI를 인간 선호에 맞추지만 다양한 답을 놓치고 과신해 신뢰하기 어려울 수 있다고 설명했다.
- 타입세이프 AI는 2년 전부터 자동화에 최적화한 새 파운데이션 모델 ‘시스템 원’을 비공개로 개발해 왔다고 밝혔다.
- 발표에서는 새로운 구조와 샘플러, 보정된 의사결정을 위한 강화학습을 시스템 원의 요소로 들었다.
04병렬 판단 구조와 가격 정책
- 발표는 언어 모델이 자연스러운 대화를 위해 순차적으로 작동하는 반면, 시스템 원은 작업을 병렬로 수행한다고 비교했다.
- 제브는 문장을 한 글자씩 생성하는 대신 정해진 선택지와 확률, 신뢰도를 출력하는 방식으로 설명됐다.
- 공개 발표에서는 제브가 100배 빠르고 100배 저렴하며 입력 10억 토큰당 42달러라고 제시했다.
- 영상은 수백 배 성능 차이가 회사 업무 평가와 공식 글의 높은 쪽 수치에 기반하므로 실제 업무에서는 별도 측정이 필요하다고 말했다.
05둠 시연의 구조화된 게임 판단
- 제브는 체력, 적 위치, 날아오는 투사체, 획득 아이템 등 구조화된 게임 상태를 받아 둠 플레이 판단을 수행했다.
- 방아쇠를 당길지, 최우선 목표가 무엇인지, 회피할지 같은 작고 형식이 정해진 질문을 반복해서 받는다.
- 질문 묶음마다 약 100밀리초, 초당 약 10번 판단하며 적을 추적·사격하거나 공격을 피하는 모습을 보였다.
- ‘쏘지 말고 피하기만 하라’는 텍스트 지시를 주자 같은 판단 구조에서 사격하지 않고 회피하는 행동으로 바뀌었다.
- 영상은 제브가 게임 화면을 직접 본 것이 아니라 정리된 데이터를 받았다는 점을 분명히 했다.
06위키 레이스 비교 결과와 조건
- 위키 레이스는 한 위키피디아 문서에서 목표 문서까지 빠르게 또는 적은 이동으로 도착하는 경기로 소개됐다.
- 야구에서 태양으로 가는 시연에서 제브는 0.4초 만에 도착했고, 두 번째로 빠른 모델보다 약 9배 빨랐다고 제시됐다.
- 해당 실행의 모든 추론 포함 비용은 0.047센트였으며, 다른 모델들은 최소 1센트이 들었다고 설명됐다.
- 테라는 현재 페이지에 없는 링크를 만들어 내 재시도가 필요했고, 이 때문에 실행 시간이 길어졌다고 언급됐다.
- 다만 공식 설명상 비교 대상 대부분은 추론을 끈 모델이었고, 추론을 켜면 상대 모델 결과도 좋아진다고 영상은 덧붙였다.
07환각 0% 표현의 한계와 검증
- 발표는 제브가 정해진 선택지와 확률을 반환하므로 환각을 일으킬 수 없다고 설명했다.
- 그러나 영상은 공식 원문에서 ‘환각 0%’가 실측 오류율이 아니라 정해진 출력 형식 보장을 뜻한다고 명시했다고 전했다.
- 주어진 선택지 밖의 항목을 만들지 않는 것과, 존재하는 선택지 중 정답을 고르는 것은 다른 문제라고 구분했다.
- 따라서 제브가 모든 작업에서 더 똑똑하다고 위키 레이스 장면만으로 결론 내릴 수는 없다고 설명했다.
08용어 사전
| 용어 | 뜻 |
|---|
| 제브 | 대화문 생성보다 구조화된 선택지에서 빠른 판단을 반복하는 자동화용 AI로 공개된 모델이다. |
| 시스템 원 | 타입세이프 AI가 자동화에 최적화한 새 파운데이션 모델로 개발 중이라고 밝힌 체계다. |
| RLHF | AI를 인간의 선호에 맞추는 사후 학습 알고리즘으로, 발표자는 다양한 답을 놓치고 과신할 수 있는 문제를 언급했다. |
| 자기회귀 | 언어 모델이 문장을 순차적으로 생성하는 방식으로, 발표에서는 병렬 판단 구조와 대비됐다. |
| 위키 레이스 | 한 위키피디아 문서에서 목표 문서까지 빠르게 또는 적은 이동으로 도달하는 비교 시연 경기다. |