01핵심 개요
- OpenAI의 GPT-4·ChatGPT·RLHF·InstructGPT 공동 저자였던 Diogo Almeida가 AI 보조 시대 이후를 발표했다.
- 그는 오늘날 LLM이 사람의 선호를 최적화하는 RLHF 기반이어서 사람 참여 작업에 강하다고 설명했다.
- 고객 서비스 의사결정처럼 사람 개입을 없애야 하는 자동화 업무에서는 AI의 한계가 두드러진다고 주장했다.
- Claude Code 역시 RLHF를 거치는 보조 도구이므로, 다음 시대의 답은 아니라고 구분했다.
- TypeSafe는 확신 수준에 맞는 의사결정을 최적화하는 새 사후 학습 방식을 비공개로 준비 중이라고 밝혔다.
02핵심 주장 / 논점 구조
- 발표자는 AI가 벤치마크에서 인간을 앞선다는 평가와, 거품이며 가치가 부족하다는 평가가 공존한다고 정리했다.
- 그는 AI가 어려운 문제를 풀면서도 고객 서비스 의사결정 같은 단순해 보이는 업무에는 약한 이유를 설명하려 했다.
- 핵심 구분은 사람을 만족시키는 보조와 사람 개입을 없애는 자동화이며, 현 LLM은 전자에 맞춰졌다는 주장이다.
- 보조 시대 다음에는 Claude Code가 아니라 실제 일을 수행하는 진정한 자동화가 와야 한다고 결론지었다.
03RLHF가 만든 사람 선호 최적화 구조
- 발표자는 RLHF를 사람의 선호를 수집하고, 그 선호에 맞춰 모델을 최적화하는 방식으로 요약했다.
- 그는 ChatGPT뿐 아니라 사용량 기준으로 거의 모든 LLM이 RLHF로 학습된다고 말했다.
- RLHF의 목적은 소프트웨어를 자율 실행하는 일이 아니라 사람의 선호를 최적화하는 것이라고 설명했다.
- 사람을 학습 과정에 넣었기 때문에 RLHF 기반 AI에 사람이 개입해야 하는 구조가 생긴다는 논리다.
04보조와 자동화의 목적 차이
- Claude Code의 목적은 코드가 작동하는 것만이 아니라 사용자를 만족시키는 것이며, 이 점에서 보조 도구라고 설명했다.
- 자동화 업무의 이상은 사람이 들여다보지 않아도 서버에서 백그라운드로 실행되는 기존 소프트웨어와 같은 형태다.
- 발표자는 정형화돼 다른 사람에게 설명할 수 있고 거의 무료로 반복할 수 있는 일도 아직 충분히 자동화되지 않았다고 봤다.
- 기업은 사업상 손실이 걸린 결정을 AI에 맡기지 않는다는 교훈을 배웠다고 언급했다.
05환각과 과도한 확신의 문제
- 발표자는 RLHF 모델이 모를 때에도 사람의 선호에 좋을 것 같은 방향으로 답한다고 설명했다.
- 방귀 효과음 파일을 음악으로 보낸 사례에서 ChatGPT가 으스스한 분위기의 작품이라고 답한 게시물을 예로 들었다.
- 그는 자동화에는 사람의 비위를 맞추는 답보다 확신 수준을 조절하며 정확히 처리하는 능력이 필요하다고 말했다.
- 환각은 사전 학습 자체의 문제가 아니라 사람 선호 최적화 과정에 내재한다고 보며, 보상 모델의 비대칭성을 언급했다.
06SaaS와 더 똑똑한 소프트웨어의 필요성
- 발표자는 SaaS가 사실상 2019년 이후 크게 달라지지 않았고, LLM 시대에도 챗봇을 붙이는 수준이라고 평가했다.
- AI가 처음부터 사람을 보조하도록 만들어졌다면 SaaS에 비서를 추가하는 형태가 된 것은 예상 가능한 결과라고 설명했다.
- Garry Tan의 ‘적시 소프트웨어의 황금기’라는 표현을 인용하면서도, 필요할 때 만드는 소프트웨어만으로는 부족하다고 말했다.
- 그가 원하는 방향은 소프트웨어 제작 비용 절감만이 아니라 표현력과 기본 구성 요소까지 달라지는 더 똑똑한 소프트웨어다.
07TypeSafe의 세 번째 사후 학습 방향
- TypeSafe는 신뢰성과 자동화를 위해 AI 기술 구조를 처음부터 다시 설계한다는 질문에서 출발한다고 밝혔다.
- 발표자는 RLVR이 아니라 새로운 방식이며, API 형태부터 RLHF·RLVR과 다르다고 말했다.
- RLHF는 사람 선호를, RLVR은 순수한 정답 여부의 로그 오류율을 최적화한다고 대비했다.
- TypeSafe의 세 번째 방식은 확신 수준에 맞는 의사결정을 최적화해 사전 학습 모델의 지능을 소프트웨어에 활용하는 방향이라고 설명했다.
08용어 사전
| 용어 | 뜻 |
|---|
| RLHF | 사람의 선호를 수집해 모델을 그 선호에 맞춰 최적화하는 사후 학습 방식으로 설명됐다. |
| RLVR | 발표자의 비교에 따르면 순수한 정답 여부의 로그 오류율을 최적화하는 사후 학습 갈래다. |
| 사후 학습 | 사전 학습된 모델의 지능을 어떤 목표에 맞춰 끌어낼지 결정하는 학습 단계로 언급됐다. |
| TypeSafe | 발표자가 비공개로 준비 중이라고 밝힌 조직으로, 신뢰성과 자동화를 위한 새 AI 구조를 연구한다. |
| Claude Code | RLHF를 거치는 보조 시대의 도구로 분류됐으며, 발표자는 이를 진정한 자동화와 구분했다. |