티타임즈TVMORNING DIGEST · 2026-08-19 · 티타임즈TV🎬 영상

토큰사용 줄이면서 품질은 유지하는 4가지 방법 (표철민 AI3 대표)

인포그래픽 요약

01핵심 개요

항목내용
형식티타임즈TV의 'AX 인사이트' 대담 코너. 표철민 AI3 대표가 진행자와 함께 기업 AI 에이전트 도입 현장에서 벌어지는 토큰 비용 폭증 문제와 해법을 이야기한다.
핵심 문제의식AX(AI 전환)가 "얼마나 많이 쓰게 할까"에서 "얼마나 가치를 창출하고 어떻게 측정할까(밸류맥스)"로 넘어가는 국면에서, 에이전트가 늘어날수록 토큰 비용이 통제 불능으로 커지는 현상이 확산되고 있다.
핵심 해법 4가지① 스마트 라우팅(작업 난이도별 모델 자동 배분) ② 맥락(컨텍스트) 정보 경량화 ③ 토큰 프루닝(도구 호출 결과 가지치기) ④ 프롬프트 캐싱
실증 사례코딩 에이전트가 그랩(파일 탐색) 도구로 214줄을 읽어오던 것을 14줄로 프루닝했더니, 토큰은 줄었는데 결과물 품질이 오히려 2% 올랐다는 논문 사례가 소개됐다.
기업 사례AI3는 지난 4월 프롬프트 캐싱을 도입해 고객사 지출을 평균 20% 낮췄으나, 한두 달 뒤 고객들이 절감된 비용만큼 더 많이 사용하며 매출이 다시 늘었다.
화자표철민(AI3 대표, LLM 게이트웨이 '비즈라우터' 운영), 티타임즈TV 진행자

02핵심 기능/내용 구조

영상은 기업의 AI 에이전트 운영에서 벌어지는 "토큰 맥싱(과다 사용)"에서 "밸류맥스(가치 극대화)"로의 전환을 주제로, 아래 순서로 대담이 진행된다.

  1. 문제 제기: AX가 양적 도입기에서 ROI(투자 대비 효과) 측정기로 넘어가는 배경 설명. 초기 에이전트 개발기에는 "결과물이 나오는가"가 최우선이라 비용을 신경 쓰지 않았지만, 모델 가격 상승과 MCP(에이전트가 외부 도구·데이터를 호출하는 표준 인터페이스) 호출 증가로 토큰 비용이 눈에 띄게 커지면서(예: 질문 한 번에 입력 토큰만 5천 원) 효율화 필요성이 대두됐다.
  2. 전략 1 - 모델 선택 재검토: 이제는 모델 성능이 전반적으로 상향 평준화돼 매번 최고급(플래그십) 모델을 쓸 필요가 없다. AI3는 노트북급 하드웨어에서 구동되는 경량 오픈소스 모델(예시로 언급된 Qwen 계열)에 필요한 맥락 정보만 정확히 넣어주면, 훨씬 비싼 고급 모델과 결과물 품질 차이가 거의 없다는 실험 결과를 공유했다.
  3. 전략 2 - 스마트 라우팅: 질문 난이도에 따라 저렴한 모델과 고급 모델로 자동 분배하는 라우터 도입. 회사들이 그동안 비용 통제보다 "일단 AX를 해보자"는 기조였던 탓에 전 직원이 최고급 모델만 써왔는데, 이제는 쉬운 작업은 경량 모델로 자동 라우팅하는 방향으로 전환되고 있다.
  4. 전략 3 - 맥락 정보 경량화: 정부 공시 API처럼 AI 시대 이전에 설계된 API를 그대로 호출하면 필요 없는 데이터까지 통째로 가져와 입력 토큰을 낭비한다. MCP 설계 단계에서 필요한 정보만 정확히 추출하도록 만드는 것이 핵심이다.
  5. 전략 3-1 - 토큰 프루닝: 코딩 에이전트의 파일 탐색(그랩) 도구가 관련 없는 내용까지 다 읽어오는 문제를 예로 들며, 실제로는 214줄 중 14줄만 필요했다는 논문 사례를 소개. 불필요한 부분을 가지치기(프루닝)하면 토큰은 줄어드는데 결과물 품질은 오히려 2% 상승했다는 결과가 보고됐다. 컨텍스트 앞쪽 정보에 비해 뒤쪽·중간 정보는 모델이 상대적으로 덜 활용하는 경향(이른바 'lost in the middle' 현상)과도 연관 지어 설명한다.
  6. 전략 4 - 캐시와 라우팅의 결합 관리: 같은 대화를 이어갈 때 프롬프트 캐싱을 활용하면 비용이 크게 줄지만, 대화 도중 스마트 라우터가 갑자기 고급 모델로 승격(에스컬레이션)시키면 기존 캐시가 무효화(캐시 라이트)되며 오히려 1.25~2배 요금이 할증된다. 따라서 스마트 라우터는 매 턴마다 독립적으로 판단하지 말고 캐시 유지 이득까지 함께 고려해야 한다.
  7. 도구 호출 통제: 에이전트에게 너무 많은 도구(손발)를 자유롭게 쓰게 하면 불필요한 탐색이 늘어나므로, 특정 업무 흐름은 미리 정해진 경로(템플릿)로 고정해 도구 호출을 결정론적으로 제한하는 것도 토큰 절약 전략이다.
  8. 스마트 라우터의 3가지 구현 방식: (1) 경량 LLM이 매 발화를 판별해 라우팅(구현은 쉽지만 비용·지연 발생) (2) BERT류 분류기 모델 사용(빠르지만 최신 모델 등장 때마다 재학습 필요) (3) 정규식·텍소노미 기반 결정론적 라우팅(AI를 아예 안 써서 빠르지만 특정 언어·산업에 한정될 때 유리). AI3의 비즈라우터는 정규식→텍소노미→LLM 폴백 순으로 발전했고, 현재는 고객 요구에 따라 옵션을 선택할 수 있게 했다.
  9. 평가(이밸류에이션) 격차: 미국은 에이전트 성능·비용을 지속 측정하는 이밸류에이션이 이미 핵심 화두이며, 기업 대신 평가를 대행하는 스타트업(YC 투자 유치 사례 포함)도 다수 등장했다. 반면 한국 기업들은 아직 "일단 만들자" 단계에 머물러 있어 본격적인 평가·최적화 단계로 넘어가지 못했다는 진단이다.
  10. AI3의 자체 경험: 고객사가 종량제로 비용을 지불하다 보니 에이전트 도입 후 지출이 급증해 AI3 매출도 늘었지만, 고객 이탈 우려로 4월에 프롬프트 캐싱을 공격적으로 도입해 평균 지출을 20% 낮췄다. 그러나 한두 달 후 고객들이 절감분만큼 더 많이 사용하며 사용량이 다시 늘었고, 이를 통해 "고객 비용을 낮추는 것이 장기적으로는 회사에도 유리하다"는 교훈을 얻었다.
  11. 모델 자체의 불안정성 사례: 최근 등장한 한 경량 모델이 버그로 인해 질문 한 번에 도구를 100번 가까이 호출해 2만 원이 청구되는 사고가 발생했고, AI3는 해당 모델로 라우팅될 경우 도구 호출을 최대 20회로 제한하는 조치를 취했다. 이는 모든 모델 제공사가 여전히 베타 수준 운영 중임을 보여주는 사례로 제시된다.
  12. AI3의 포지셔닝: 모델 개발사와 고객 사이에서 비용·성능 최적화를 대신 고민해주는 중개자 역할을 자임하며, "예전엔 API 래퍼(단순 중개자) 아니냐는 말을 들었지만 이제는 필요한 존재"라고 자평했다.

03기술적 맥락

토큰 비용 폭증의 근본 원인은 에이전트 아키텍처의 세대 전환에 있다. 1세대 에이전트는 RAG(검색증강생성)와 프롬프트 조합으로 만들어졌고, 2세대는 MCP(Model Context Protocol, 에이전트가 외부 도구·데이터베이스를 표준화된 방식으로 호출하는 프로토콜)를 도입해 훨씬 많은 도구 호출이 발생한다. 문제는 MCP가 연결하는 기존 API(예: 금융감독원 전자공시 API)가 AI 이전 시대에 설계돼, 필요한 정보(예: 특정 기업의 최근 3개월 지분 변동)만 요청하는 게 아니라 관련 데이터를 통째로 반환한다는 점이다. 이 원본 데이터가 그대로 모델의 컨텍스트(맥락 창)에 실리면서 입력 토큰이 기하급수적으로 늘어난다. 토큰 프루닝은 이 문제를 도구 설계 단계에서 해결하는 접근으로, 논문 사례(214줄→14줄 축소, 품질 2% 향상)는 정보량과 성능이 반드시 비례하지 않으며 오히려 불필요한 정보가 컨텍스트 앞·중간·뒤 위치에 따라 모델의 주의(attention) 성능을 떨어뜨릴 수 있음을 시사한다. 스마트 라우터는 크게 세 갈래 기술로 나뉜다. LLM 기반 판별(정확하지만 비용·지연 발생), 경량 분류기 모델(BERT류, 빠르지만 신모델 출시마다 재학습 필요), 정규식·텍소노미 기반 결정론적 분기(AI 미사용, 특정 도메인에 최적화될 때 유리)다. 프롬프트 캐싱은 동일 세션 내 반복되는 컨텍스트를 재계산하지 않고 재사용해 비용을 낮추는 기법이나, 세션 도중 모델이 교체(라우팅 승격)되면 캐시가 무효화(캐시 라이트, cache write)되어 오히려 1.25~2배의 요금이 추가되는 트레이드오프가 있다.

04전략적 의미

첫째, AI 에이전트 비용 최적화는 이제 "부가 기능"이 아니라 기업 AX 성패를 가르는 핵심 경쟁력으로 부상하고 있다. 미국 선도 기업들이 이미 이밸류에이션(성능·비용 평가) 중심 단계로 넘어간 반면, 한국 기업들은 여전히 "일단 만들어보자" 단계에 머물러 있어 격차가 벌어지고 있다는 진단은 국내 기업들에 시급한 경고 신호다. 둘째, 모델 성능이 상향 평준화되면서 "무조건 최고급 모델"이라는 관성적 선택이 낭비로 이어진다는 점은, 앞으로 AI 도입 전략에서 모델 선택 자체가 비용 관리의 핵심 레버가 됨을 뜻한다. 셋째, LLM 게이트웨이·라우터 서비스(AI3의 비즈라우터 등)처럼 모델 제공사와 기업 고객 사이에서 최적화를 대행하는 중개 산업이 성장하고 있으며, 이는 향후 AI 밸류체인에서 "미들웨어" 계층의 중요성이 커질 것을 시사한다. 넷째, AI 제공사 입장에서 고객 비용을 낮추는 캐싱 등 최적화 기능은 단기 매출 감소를 유발하지만, 장기적으로 고객 이탈을 막고 사용량 자체를 늘리는 선순환으로 이어질 수 있다는 점은 SaaS·AI 서비스 업계 전반의 가격 전략에 시사점을 준다. 다섯째, 모델 자체의 버그(과도한 도구 호출 등)로 인한 비용 폭증 사례는, AI 인프라가 여전히 베타 수준이며 기업들이 모델 제공사에만 의존하기보다 자체적인 비용 안전장치(가드레일)를 갖춰야 함을 보여준다.

05핵심 워크플로우·방법론

실무자가 참고할 수 있는 토큰 절감 워크플로우를 정리하면 다음과 같다.

  1. 모델 재선정: 현재 사용 중인 작업에 실제로 플래그십 모델이 필요한지 재검토하고, 경량·오픈소스 모델로 교체했을 때 품질 차이를 A/B 테스트로 확인한다.
  2. 스마트 라우터 도입: 작업 난이도별로 모델을 자동 분기하는 라우터를 구축하거나 기존 LLM 게이트웨이 서비스를 도입한다. 구현 방식은 정규식(가장 빠르고 단순) → 분류기 모델(중간) → LLM 판별(가장 유연하지만 느림) 중 조직 상황에 맞게 선택한다.
  3. MCP·도구 설계 재점검: 외부 API·DB를 호출하는 MCP 도구가 필요한 정보만 정확히 반환하도록 재설계한다(전체 테이블이 아닌 필요한 행·컬럼만 조회).
  4. 토큰 프루닝 적용: 도구 호출 결과물 중 실제로 필요한 부분만 컨텍스트에 남기고 나머지는 잘라낸다(예: 파일 탐색 결과 214줄 중 14줄만 유지).
  5. 캐시-라우팅 정합성 관리: 세션 도중 모델을 승격시킬지 판단할 때 캐시 무효화 비용까지 함께 계산해, 잦은 모델 전환이 오히려 비용을 늘리지 않도록 설계한다.
  6. 도구 호출 범위 제한: 에이전트가 스스로 판단해 여러 도구를 순회하게 두지 말고, 자주 쓰이는 작업 흐름은 미리 정해진 경로(템플릿)로 고정해 불필요한 탐색을 차단한다.
  7. 비용 안전장치 마련: 특정 모델의 버그성 과다 호출에 대비해 도구 호출 횟수 상한 등 하드 리밋을 설정한다.
  8. 지속 평가(이밸류에이션) 체계 구축: 모델·프롬프트·MCP를 바꿀 때마다 비용 대비 품질 변화를 백테스트하고, 변경 전후 성능 저하 여부를 정량적으로 추적한다.

06활용 시나리오

  1. 스타트업·중소기업의 AI 에이전트 비용 관리: 자체 개발한 사내 에이전트의 월 토큰 비용이 예상보다 크게 나올 때, 스마트 라우팅과 토큰 프루닝을 우선 적용해 비용을 20% 안팎으로 낮추는 개선 프로젝트에 참고할 수 있다.
  2. 기업 IT/AI 담당자의 MCP 설계 점검: 외부 공공 API·사내 DB를 연동하는 MCP 도구를 새로 만들거나 개선할 때, "필요한 정보만 정확히 반환하는가"를 체크리스트로 활용해 불필요한 토큰 낭비를 사전에 차단할 수 있다.
  3. LLM 게이트웨이·SaaS 제품 기획자: 고객사의 비용 급증으로 인한 이탈을 막기 위한 프롬프트 캐싱·라우팅 기능을 설계할 때, AI3의 4월 캐싱 도입 사례(지출 20% 감소 후 사용량 재증가)를 벤치마크로 삼을 수 있다.
  4. 코딩 에이전트 개발자의 도구 최적화: 그랩(파일 탐색)류 도구가 과도하게 많은 내용을 컨텍스트에 싣는 문제를 인지하고, 논문에서 제시된 토큰 프루닝 기법(214줄→14줄)을 자사 코딩 에이전트에 적용해보는 실험에 참고할 수 있다.

07현황 및 전망

2026년 8월 기준, AI 에이전트를 이미 도입한 기업들 사이에서 "결과물을 만드는 단계"에서 "비용 대비 가치를 측정·최적화하는 단계(밸류맥스)"로의 전환이 화두로 떠오르고 있다. 미국은 이밸류에이션 전문 스타트업이 다수 등장하며 이미 최적화 단계에 진입했지만, 한국은 아직 "일단 만들자" 단계에 머물러 있어 표철민 대표는 "선도 기업들이 최적화(깎기) 단계로 넘어가는 모습이 보이면 다시 초청하겠다"는 취지로 언급하며 향후 흐름을 지켜볼 것을 시사했다. 스마트 라우터 기술은 정규식·분류기·LLM 판별 방식이 혼합되는 방향으로 발전 중이며, AI3의 비즈라우터도 고객 요구에 따라 여러 방식을 선택 가능하게 옵션을 확장했다. AI3는 한 고객사에서 발견된 문제(모델 버그로 인한 과다 호출 등)를 해결하면 전체 고객 기반에 패치를 적용하는 방식으로 집단적 학습 효과를 축적하고 있다고 밝혔다. 프론티어 모델 제공사(앤트로픽 등)조차 신모델 출시 직후 토큰 사용량이 급증했다가 시간이 지나며 안정화되는 패턴을 보이는 등, 모델 제공사 자신도 비용 구조를 완전히 통제하지 못하는 상황이 당분간 이어질 것으로 전망된다.

08용어 사전

용어한줄설명비유/예시
AXAI 전환(AI Transformation), 기업이 AI로 업무·사업을 혁신하는 과정DX(디지털 전환)의 다음 단계
밸류맥스토큰 사용량이 아닌 비용 대비 창출 가치를 극대화하는 접근"많이 쓰기"에서 "잘 쓰기"로의 전환
토큰 맥싱비용을 따지지 않고 토큰(모델 입출력 단위)을 최대한 많이 쓰는 초기 단계에이전트 도입 초창기의 "일단 결과만 내면 된다" 기조
MCP에이전트가 외부 도구·데이터베이스를 표준화된 방식으로 호출하는 프로토콜에이전트의 "손발" 역할, 2세대 에이전트의 핵심 구성요소
토큰 프루닝컨텍스트에 실리는 도구 호출 결과 중 불필요한 부분을 가지치기하는 기법214줄짜리 파일 탐색 결과를 14줄로 축소한 논문 사례
프롬프트 캐싱반복되는 컨텍스트를 재계산하지 않고 저장해 재사용, 비용을 낮추는 기법같은 대화를 이어갈 때 매번 전체를 다시 계산하지 않음
캐시 라이트캐시가 무효화돼 새로 컨텍스트를 처리하며 발생하는 추가 비용(1.25~2배 할증)대화 중 모델이 갑자기 고급 모델로 바뀔 때 발생
스마트 라우터작업 난이도에 따라 저렴한 모델과 고급 모델로 요청을 자동 분배하는 시스템해리포터의 '말하는 모자'가 기숙사를 배정하는 것에 비유
이밸류에이션AI 에이전트의 성능·비용을 지속적으로 측정·평가하는 활동미국에서는 이를 대행하는 전문 스타트업까지 등장
LLM 게이트웨이여러 AI 모델을 중개·라우팅해주는 서비스형 인프라AI3가 운영하는 '비즈라우터'가 해당
lost in the middle컨텍스트가 길어질수록 중간 위치 정보에 대한 모델 성능이 떨어지는 현상긴 문서 중간 내용을 모델이 자주 놓치는 경향
티타임즈TV · 2026-08-19
← 목록으로