01토큰맥싱의 종말 — 비용이 규정한 전환
불과 6개월 전만 해도 사내에 '어제 토큰 사용 랭킹'을 리더보드로 붙이는 것이 자랑이던 시절. 그러나 에이전트가 사람 100번 쓸 대화를 한 번에 소진하고, 미국 기업 73%가 1년 예산을 조기·초과 소진하면서 경영진이 제동을 걸기 시작. 2년간 토큰 사용량은 22배로 늘었고, 페이블·GPT-5.6 등 고가 모델을 '내 돈 아니니' 직원들이 최상위만 쓰는 것도 비용을 키웠다. 이제 토큰맥싱 주장 자체가 'AI 워싱'처럼 비쳐 미국에선 잘 언급하지 않는 분위기.
02기업 도입 패턴 — 첫 주 트래픽의 함정
기업은 보안 우려로 도입 의사결정에 약 1년이 걸리지만, 통과 후엔 관대하게 풀어준다. 전형적으로 첫 주 트래픽이 폭증했다가 일주일 뒤 급락 — AI를 잘 다루는 일부만 남고 나머지는 이탈하기 때문. 첫 주 폭증에 놀라 서비스를 꺼버리는 관리자도 있으나, 몇 주 두면 그 회사 실제 AI 활용 역량으로 수렴한다. 이미 챗GPT·클로드를 개인 결제로 잘 쓰던 회사는 사내 도입 시 사용량이 매주 증가한다.
03업종·환경별 격차
망분리 회사는 외산 AI를 쓸 수 없어 내부망 활용률이 크게 떨어지고(사내 문서 업로드 불가), 망분리가 없는 기관은 훨씬 잘 쓴다. 제조·건설처럼 컴퓨터 앞 인원이 적은 업종은 평균 사용률이 낮다. 관리자는 이 지표로 인재개발팀을 통한 교육을 강화하거나, 반대로 잘 쓰는 조직의 사례를 확산한다.
04왜 한 질문의 토큰이 폭증하나
과거엔 챗봇이 학습 내용을 읊는 수준이었으나, 이제 에이전트가 사용자의 한두 문장 질문을 스스로 프롬프트로 풍부화하고, 연결된 손발(법제처·국가통계·KB부동산 시세·국토부 등)을 판단해 데이터를 맥락에 실어온다. 사용자는 100자만 물었는데 국가 데이터 조회로 입력 토큰이 500~1,000자로 불어난다. 양질의 답을 주기 위한 필연적 증가이며, 표 대표는 앞으로 토큰량이 지금과 비교 불가하게 더 늘 것으로 전망(내년엔 지금 못 맡기는 일까지 맡길 것이므로).
05밸류맥싱의 실전 해법 — 경량 LLM 선행 설계
한화 사례: 20여 개 사내 데이터 MCP(원가·공정 등)를 주고 에이전트에 자율 판단을 맡겼더니 매번 경로·결과가 달라지고 토큰 낭비·일관성 저하가 심했다. 개선책은 사용자 요구가 들어오면 경량 LLM이 먼저 도구 목록·목표를 받아 워크플로를 빠르게 설계하고, 그 워크플로를 플래그십 LLM에 넘기는 방식 — 일관성↑·토큰↓. 다른 고객사는 파이썬으로 결정론적 호출 순서(다트→나이스 신용평가→PDF 생성→LLM 전달)를 강제하는 MCP를 별도로 만들어 같은 문제를 해결.
06사내 데이터 연동과 '프런트엔드'화
웍스 AI는 그룹웨어·ERP·M365·전자결재 등을 MCP로 연동해, "내 휴가 며칠 남았지" "2시 회의 가능한 회의실 예약" "온 전자결재 승인" 등을 자연어로 처리. 그룹웨어 메뉴를 파고들던 작업을 AI가 대신하는 '프런트엔드'가 된다. SAP 연동 원가 자동 계산 후 매일 아침 경영진 보고, 공장 DB 연동 수율 자동 집계(권한 있는 부서에만 공유되는 에이전트) 등 고객이 창의적으로 활용하는 사례가 대표조차 놀랄 정도로 많다.
07RAG의 재평가와 'MCP로 꽃핀' 시대
2년 전 모두가 매달렸던 RAG는 300페이지 PDF에서 관련 문단만 청킹·유사도로 실어 생성하는 태생상 100% 정확할 수 없는 기술 — 숫자 오류에 실망해 "생성형 AI는 안 된다"며 포기한 1세대 AX 회사가 많았다. 그러나 이제 MCP로 자연어를 SQL로 바꿔 DB를 직접 쿼리해 필요한 정보만 맥락에 싣고, 모델 자체 성능도 올라 할루시네이션이 크게 줄었다. 빅데이터 시절 데이터 레이크를 구축해둔 회사는 'MCP 파이프만 꽂으면' 되어 유리. 결론적으로 지금이 사내에서 AI를 본격 활용하는 진짜 초입이다.
08용어 사전
- 토큰맥싱(Token-maxing): AI를 최대한 많이 쓰게 해 효율을 극대화하려는 초기 도입 전략.
- 밸류맥싱(Value-maxing): 사용량이 아니라 창출 가치·ROI를 기준으로 AI를 효율적으로 쓰는 국면.
- MCP: 모델이 사내·공공 데이터·도구에 접근하도록 연결하는 표준 인터페이스.
- 경량 LLM 선행 설계: 저비용 모델이 워크플로를 먼저 짜고 플래그십 모델이 실행하는 구조.
- RAG: 문서를 청킹·유사도 검색해 맥락에 실어 답을 생성하는 검색증강 기법.
- 망분리: 내부망과 외부망을 분리한 보안 환경(외산 AI 활용 제약).
