메이커 에반 | Maker EvanYOUTUBE SUMMARIES · 2026-09-23 · 메이커 에반 | Maker Evan🎬 영상

타입세이프의 Jev는 대화 대신 구조화된 판단으로 비용과 지연을 낮춘다.

Jev는 글 대신 판단만 수행해 에이전트 라우팅·도구 게이팅에 쓰는 모델이다.

인포그래픽 요약

01핵심 개요

  • 타입세이프는 2024년 설립된 샌프란시스코 스타트업으로, 9월 15일 판단 전용 모델 Jev를 공개했다.
  • Jev는 선택·점수화·참거짓 판단만 수행하며, 문장·코드·판단 이유를 생성하지 않고 확률과 신뢰도를 반환한다.
  • 회사 벤치마크에서 Jev는 정확도 67.8%, 응답 0.4초로 GPT-5.6 테라와 유사한 정확도를 제시했다.
  • 타입세이프는 입력 100만 토큰당 4센트, 오퍼스 5 대비 440배 낮은 비용을 내세우지만 검증은 아직이다.
  • 에이전트에서는 모델 라우팅과 도구 호출 게이팅에 쓰며, 낮은 신뢰도의 판단은 느린 모델이나 사람에게 넘긴다.

02핵심 주장 / 논점 구조

  • Jev는 챗봇이나 코드 생성 모델을 대체하는 제품이 아니라, 소프트웨어 내부의 반복적 판단을 위한 모델로 소개된다.
  • 타입세이프는 프론티어 모델 대비 200배 빠르고 400배 싸다고 내세우며, 오퍼스 5 대비 비용은 440배 낮다고 밝혔다.
  • 영상은 Jev의 구조와 에이전트 활용처를 설명하는 동시에 자체 벤치마크·불투명성·가격 지속성의 한계를 함께 제시한다.

03타입세이프 설립 배경과 Jev의 이름

  • 타입세이프는 2024년에 설립됐고, 대표 디오고 알메이다는 오픈AI에서 약 4년간 인스트럭트GPT·ChatGPT·GPT-4 강화학습에 관여했다.
  • 회사는 사람과 대화하는 모델 대신 소프트웨어 안에서 결정하는 모델을 만들겠다는 반대 연구 방향을 회사 소개에 내세웠다.
  • DCVC 주도로 4,000만 달러 시드 투자를 받았으며, 기업가치는 2억 달러로 언급됐다.
  • Jev라는 이름은 19세기 경제학자 윌리엄 스탠리 제번스와 제번스의 역설에서 가져왔으며, AI가 싸지면 더 많은 곳에 쓰일 것이라는 기대를 담았다.

04시스템 1 설계와 RLCD 보정 방식

  • 영상은 카너먼의 『생각에 관한 생각』을 바탕으로 빠르고 직관적인 시스템 1과 느리고 숙고하는 시스템 2를 대비한다.
  • Jev의 기능은 보기 중 하나를 고르는 Choice, 기준에 따른 Score, 참거짓 확률을 내는 Know의 세 가지로 한정된다.
  • 각 답에는 확률과 별도의 confidence 값이 붙으며, 확률은 정답 가능성이고 confidence는 해당 판단에 대한 모델의 확신으로 설명된다.
  • 타입세이프는 보정된 결정을 위한 강화학습인 RLCD를 사용했고, 학습 데이터는 전부 합성 데이터라고 밝혔다.

05고객 티켓 호출 예시와 구조화 출력

  • 공식 예제는 스트라이프 연동 장애와 매출 하락을 호소한 고객 메시지를 state에 넣고 담당 팀·감정·긴급성을 한 번에 묻는다.
  • 응답 JSON의 answers에는 담당 팀으로 기술팀 85%, 감정 단계로 짜증 1.0, 긴급 여부는 참과 90% 이상의 확률이 제시된다.
  • Jev는 결제팀·기술팀·영업팀처럼 미리 정한 값에서만 고르므로, 지정되지 않은 마케팅팀을 답하는 식의 구조화 출력 오류를 막는다고 설명한다.
  • 응답 시간은 70~500밀리초로 제시되며, LLM의 JSON 프롬프트·파싱·재시도 과정을 줄이는 방식이다.

06벤치마크 비용과 에이전트 적용처

  • 타입세이프의 4개 워크플로 벤치마크에서 Jev는 정확도 67.8%, 응답 0.4초였고 GPT-5.6 테라는 67.9%, 10.1초였다.
  • 오퍼스 5는 정확도 73.1%, 응답 37.8초로 제시됐으며, 영상은 Jev가 속도에서 25~90배 차이를 보인다고 설명한다.
  • 입력 가격은 100만 토큰당 4센트이고 출력은 무료이며, 건당 처리 비용은 약 0.04센트라고 소개된다.
  • 랭체인은 Jev를 단순 요청과 복잡 요청의 모델 라우팅, 파일 삭제·결제 전 위험 판단을 위한 도구 호출 게이팅에 활용하는 예시를 제시했다.
  • 문서상 사례에는 브라우저 조작 에이전트, 실시간 트레이딩 에이전트, 대량 이메일 분류가 있으며 모두 글 생성 없이 판단이 많은 작업이다.

07검증 한계와 도입 시 점검 사항

  • 벤치마크는 타입세이프 팀이 만들었고, 회사는 기술 문서에서 편향 가능성과 실제 결과가 더 낮을 수 있음을 인정했다.
  • 정답 라벨도 사람이 아닌 다른 모델이 매겼으며, 청구서 처리에서는 Jev가 61.8%, 비교 모델이 79.1%로 17점 이상 차이가 났다.
  • 회사가 말한 환각 0%는 정해진 값 밖으로 답하지 않는다는 뜻이며, 선택한 값 자체가 틀리거나 높은 확률로 틀릴 수 있다.
  • Jev는 판단 이유를 제공하지 않아 금융·의료처럼 이유 기록이 필요한 분야에 제약이 있으며, RLCD 논문·가중치·아키텍처도 공개되지 않았다.
  • 가격의 지속 가능성은 확답되지 않았고 초기 보조금 가능성이 언급됐으며, 서비스는 현재 얼리 액세스 상태다.

08용어 사전

용어뜻
Jev타입세이프가 공개한 판단 전용 모델로, 선택·점수화·참거짓 판단과 확률·신뢰도를 반환한다.
시스템 1영상에서 빠르고 직관적인 판단 방식으로 설명되며, Jev의 설계 방향을 가리킨다.
RLCD타입세이프가 확률 보정을 위해 사용했다고 밝힌 '보정된 결정을 위한 강화학습' 알고리즘이다.
confidence답의 정답 확률과 별개로 모델이 판단에 얼마나 확신하는지를 나타내며, 실행·사람 이관 기준으로 쓰인다.
신뢰도 게이트 라우팅Jev의 판단과 신뢰도를 바탕으로 바로 실행하거나 느린 모델 또는 사람에게 넘기는 구조다.
메이커 에반 | Maker Evan · 2026-09-23
← 목록으로