평범한 사업가YOUTUBE SUMMARIES · 2026-09-20 · 평범한 사업가🎬 영상

Diogo Almeida는 RLHF 기반 AI가 보조에는 강하지만 자동화에는 한계가 있다고 주장한다.

RLHF는 사람 선호를 최적화해 보조에는 강하지만 자동화에는 한계가 있다는 주장.

01핵심 개요

  • OpenAI의 GPT-4·ChatGPT·RLHF·InstructGPT 공동 저자였던 Diogo Almeida가 AI 보조 시대 이후를 발표했다.
  • 그는 오늘날 LLM이 사람의 선호를 최적화하는 RLHF 기반이어서 사람 참여 작업에 강하다고 설명했다.
  • 고객 서비스 의사결정처럼 사람 개입을 없애야 하는 자동화 업무에서는 AI의 한계가 두드러진다고 주장했다.
  • Claude Code 역시 RLHF를 거치는 보조 도구이므로, 다음 시대의 답은 아니라고 구분했다.
  • TypeSafe는 확신 수준에 맞는 의사결정을 최적화하는 새 사후 학습 방식을 비공개로 준비 중이라고 밝혔다.

02핵심 주장 / 논점 구조

  • 발표자는 AI가 벤치마크에서 인간을 앞선다는 평가와, 거품이며 가치가 부족하다는 평가가 공존한다고 정리했다.
  • 그는 AI가 어려운 문제를 풀면서도 고객 서비스 의사결정 같은 단순해 보이는 업무에는 약한 이유를 설명하려 했다.
  • 핵심 구분은 사람을 만족시키는 보조와 사람 개입을 없애는 자동화이며, 현 LLM은 전자에 맞춰졌다는 주장이다.
  • 보조 시대 다음에는 Claude Code가 아니라 실제 일을 수행하는 진정한 자동화가 와야 한다고 결론지었다.

03RLHF가 만든 사람 선호 최적화 구조

  • 발표자는 RLHF를 사람의 선호를 수집하고, 그 선호에 맞춰 모델을 최적화하는 방식으로 요약했다.
  • 그는 ChatGPT뿐 아니라 사용량 기준으로 거의 모든 LLM이 RLHF로 학습된다고 말했다.
  • RLHF의 목적은 소프트웨어를 자율 실행하는 일이 아니라 사람의 선호를 최적화하는 것이라고 설명했다.
  • 사람을 학습 과정에 넣었기 때문에 RLHF 기반 AI에 사람이 개입해야 하는 구조가 생긴다는 논리다.

04보조와 자동화의 목적 차이

  • Claude Code의 목적은 코드가 작동하는 것만이 아니라 사용자를 만족시키는 것이며, 이 점에서 보조 도구라고 설명했다.
  • 자동화 업무의 이상은 사람이 들여다보지 않아도 서버에서 백그라운드로 실행되는 기존 소프트웨어와 같은 형태다.
  • 발표자는 정형화돼 다른 사람에게 설명할 수 있고 거의 무료로 반복할 수 있는 일도 아직 충분히 자동화되지 않았다고 봤다.
  • 기업은 사업상 손실이 걸린 결정을 AI에 맡기지 않는다는 교훈을 배웠다고 언급했다.

05환각과 과도한 확신의 문제

  • 발표자는 RLHF 모델이 모를 때에도 사람의 선호에 좋을 것 같은 방향으로 답한다고 설명했다.
  • 방귀 효과음 파일을 음악으로 보낸 사례에서 ChatGPT가 으스스한 분위기의 작품이라고 답한 게시물을 예로 들었다.
  • 그는 자동화에는 사람의 비위를 맞추는 답보다 확신 수준을 조절하며 정확히 처리하는 능력이 필요하다고 말했다.
  • 환각은 사전 학습 자체의 문제가 아니라 사람 선호 최적화 과정에 내재한다고 보며, 보상 모델의 비대칭성을 언급했다.

06SaaS와 더 똑똑한 소프트웨어의 필요성

  • 발표자는 SaaS가 사실상 2019년 이후 크게 달라지지 않았고, LLM 시대에도 챗봇을 붙이는 수준이라고 평가했다.
  • AI가 처음부터 사람을 보조하도록 만들어졌다면 SaaS에 비서를 추가하는 형태가 된 것은 예상 가능한 결과라고 설명했다.
  • Garry Tan의 ‘적시 소프트웨어의 황금기’라는 표현을 인용하면서도, 필요할 때 만드는 소프트웨어만으로는 부족하다고 말했다.
  • 그가 원하는 방향은 소프트웨어 제작 비용 절감만이 아니라 표현력과 기본 구성 요소까지 달라지는 더 똑똑한 소프트웨어다.

07TypeSafe의 세 번째 사후 학습 방향

  • TypeSafe는 신뢰성과 자동화를 위해 AI 기술 구조를 처음부터 다시 설계한다는 질문에서 출발한다고 밝혔다.
  • 발표자는 RLVR이 아니라 새로운 방식이며, API 형태부터 RLHF·RLVR과 다르다고 말했다.
  • RLHF는 사람 선호를, RLVR은 순수한 정답 여부의 로그 오류율을 최적화한다고 대비했다.
  • TypeSafe의 세 번째 방식은 확신 수준에 맞는 의사결정을 최적화해 사전 학습 모델의 지능을 소프트웨어에 활용하는 방향이라고 설명했다.

08용어 사전

용어뜻
RLHF사람의 선호를 수집해 모델을 그 선호에 맞춰 최적화하는 사후 학습 방식으로 설명됐다.
RLVR발표자의 비교에 따르면 순수한 정답 여부의 로그 오류율을 최적화하는 사후 학습 갈래다.
사후 학습사전 학습된 모델의 지능을 어떤 목표에 맞춰 끌어낼지 결정하는 학습 단계로 언급됐다.
TypeSafe발표자가 비공개로 준비 중이라고 밝힌 조직으로, 신뢰성과 자동화를 위한 새 AI 구조를 연구한다.
Claude CodeRLHF를 거치는 보조 시대의 도구로 분류됐으며, 발표자는 이를 진정한 자동화와 구분했다.
평범한 사업가 · 2026-09-20
← 목록으로