
01핵심 개요
| 항목 | 내용 |
|---|
| 발표자/채널 | Chase AI |
| 주제 | 클로드 코드(Claude Code) 토큰 비용을 최대 20배까지 절약하는 5가지 실전 팁 |
| 핵심 주장 | 프롬프트 캐싱 원리를 모르면 캐시가 만료된 대화 재전송 시 최대 20배 비싸게 과금됨 |
| 대상 독자 | 클로드 코드/API를 업무에 상시 사용하는 개발자, AI 실무자 |
| 난이도 | 중급 (토큰·컨텍스트 창 기본 개념 필요) |
02핵심 기능/내용 구조
영상은 다음 5가지 팁을 순서대로 다룬다.
- 프롬프트 캐싱 작동 원리 이해 (가장 중요, 나머지 팁을 합친 것보다 절감 효과 큼)
- 캐시가 만료됐을 때(대화가 오래 방치됐을 때) 선택할 수 있는 3가지 대응법
- 모델 라우팅 — 작업 난이도에 맞는 모델 선택(어드바이저 모드 등)
/doctor 명령으로 CLAUDE.md·스킬·MCP 정리(클로드 위생)
- 출력 토큰을 줄이는 보조 기술(포니테일 인코딩, Caveman 등) — 효과는 상대적으로 작음
03기술적 맥락
- 토큰 요금 구조: 출력 토큰이 입력 토큰보다 약 5배 비싸다. Sonnet 기준 출력 토큰은 백만 개당 약 50달러(Opus는 25달러 수준으로 언급).
- 컨텍스트 창: 토큰이 화폐라면 컨텍스트 창(예: 100만 토큰)은 예산에 해당한다.
- 누적 전송 구조: 대화형 LLM은 매 메시지마다 그 이전 대화 전체를 다시 서버로 전송한다. 메시지가 쌓일수록 입력 토큰 비용이 기하급수적으로 증가한다.
- 프롬프트 캐시: 클로드는 대화 내용을 "캐시 문서"처럼 저장해 이후 메시지에서는 그 문서를 훨씬 저렴하게 "읽기"만 하면 된다. 캐시가 없으면 매번 전체 대화를 새로 계산(cache write)해야 한다.
- 캐시 유효시간: 기본 캐시는 아무 활동 없이 1시간이 지나면 소멸한다(5분 캐시 옵션은 API 사용자용으로 별도 존재). 마지막 메시지 이후 59분에 새 메시지를 보내면 캐시가 갱신(refresh)된다.
- 가격 차이(20배의 근거): 캐시 최초 생성(cache write)은 백만 토큰당 20달러, 캐시 읽기(cache hit)는 백만 토큰당 1달러로 20배 차이. 캐시가 만료된 뒤 다시 쓰면 동일하게 20배 비싼 요금이 적용된다.
- 캐시 초기화 트리거: 모델 전환(예: Sonnet→Opus), MCP 서버 연결/해제, 대화 압축(compact) 도구 사용, 클로드 코드 업그레이드 거부 등에서 캐시가 초기화될 수 있다.
04전략적 의미
- 클로드 코드 사용자 대부분이 인지하지 못한 채 "캐시 쓰기 요금(20달러/백만 토큰)"을 상시로 지불하고 있을 가능성이 있다.
- 장시간 자리를 비우는 업무 패턴(회의, 점심, 야간 등) 자체가 곧바로 비용 급등 요인이 된다 — 예시에서 50만 토큰 대화 방치 시 다음 메시지 비용이 0.5달러에서 10달러로 20배 상승.
- 모델 라우팅(대형 모델이 계획, 소형 모델이 실행)과 클로드 위생(
/doctor)은 캐싱 이해에 비하면 부수적 절감 수단이지만, 누적되면 유의미하다.
- 비용 최적화는 단순 절약을 넘어, 컨텍스트 오류(약 67만~80만 토큰대에서 발생) 회피와 응답 속도 개선에도 직결된다.
05핵심 워크플로우·방법론
/clear — 대화 기록 전체 삭제 후 새로 시작. 코드베이스 자체가 증거로 남아있는 프로젝트 작업에 적합.
/compact — 클로드 네이티브 압축 기능으로 대화를 요약해 새 대화 컨텍스트에 삽입. 메시지 기록 내에 요약이 남는다.
- 커스텀 핸드오프(handoff) 스킬 — 요약을 디스크의 마크다운 파일로 저장 후 새 대화에서 해당 문서를 참조. compact와 달리 파일로 영속화된다는 점이 차이.
- 대형/고성능 모델(Opus 등)이 작업 계획을 수립
- 소형 모델(Sonnet 등)이 실제 작업을 실행
- 실행 중 문제가 생기면 소형 모델이 대형 모델과 컨텍스트를 공유해 조언을 받음
- 각 모델이 각자의 프롬프트 캐시를 별도로 유지해 동시에 비용 효율을 얻음
06활용 시나리오
- 장시간 코드 리뷰 세션 후 재개: 점심시간(1시간+) 후 복귀 시, 새 메시지를 바로 보내지 않고 먼저
/compact 또는 handoff로 요약을 남긴 뒤 새 대화를 시작해 20배 요금을 피한다.
- 대규모 리팩터링 프로젝트: 파일이 많고 컨텍스트가 복잡한 작업에서 대화가 길어지면
/clear 후 코드베이스 자체를 근거로 새 대화를 시작해 불필요한 이력비용을 없앤다.
- 일상적 반복 작업(포맷 변환, 간단한 버그 수정 등): Opus/Sonnet 대신 GPT 계열 저가 모델이나 로컬 모델로 라우팅해 캐시 쓰기 비용 자체를 회피한다.
- 팀 전체 클로드 코드 운영 표준화: 정기적으로
/doctor를 실행해 CLAUDE.md와 미사용 스킬을 정리, 대화 시작 시점의 기본 토큰 소모(예시에서 4만 토큰)를 줄인다.
07현황 및 전망
- 클로드 코드 창시자 보리스 처니가 "CLAUDE.md 삭제"를 주장하는 영상이 화제가 된 배경: 최신 모델(5 시리즈)은 과거처럼 장황한 설명이 필요 없어, 비대해진 CLAUDE.md가 속도 저하와 토큰 낭비의 원인이 되고 있다.
- 출력 토큰 절감 기법(포니테일, Caveman 등)은 벤치마크상 최대 65% 절감을 주장하지만, 발표자는 이를 "가장 효과가 떨어지는" 부수적 팁으로 평가하며 프롬프트 캐싱 이해가 여전히 핵심이라고 강조한다.
- GPT 계열(루나, 테라 등) 모델의 가격 인하로 외부 모델 라우팅의 실효성이 높아지는 추세.
08용어 사전
| 용어 | 한줄 설명 | 비유 |
|---|
| 프롬프트 캐싱 | 대화 이력을 저장해 재전송 시 저렴하게 읽는 과금 방식 | 매번 새로 쓰지 않고 저장된 문서를 다시 읽는 것 |
| 캐시 쓰기(cache write) | 대화 이력을 새로 캐시에 기록하는 비싼 연산 | 문서를 처음 인쇄하는 비용 |
| 캐시 읽기(cache hit) | 이미 캐시된 대화를 저렴하게 불러오는 연산 | 인쇄된 문서를 다시 훑어보는 비용 |
| 컨텍스트 창 | 모델이 한 번에 다룰 수 있는 토큰 총량 | 대화에 쓸 수 있는 예산 |
| /compact | 대화를 요약해 새 컨텍스트로 압축하는 클로드 명령 | 회의록을 한 페이지로 요약 |
| 핸드오프(handoff) | 대화 요약을 디스크 파일로 저장해 인계하는 방식 | 인수인계 문서를 파일로 남기기 |
| 어드바이저 모드 | 대형 모델이 계획, 소형 모델이 실행하는 협업 구조 | 상사가 지시하고 실무자가 처리 |
09딥링크
- 프롬프트 캐싱 20배 가격 차이 설명: https://youtu.be/V0XbuApxlhg&t=333초
- 캐시 만료 시 대응 3가지 옵션(clear/compact/handoff): https://youtu.be/V0XbuApxlhg&t=619초
- 모델 라우팅·어드바이저 모드: https://youtu.be/V0XbuApxlhg&t=782초
- /doctor로 CLAUDE.md·스킬 정리: https://youtu.be/V0XbuApxlhg&t=1000초