단테랩스MORNING DIGEST · 2026-07-04 · 단테랩스🎬 영상

로컬 LLM 제대로 돌리려면 — VRAM이 전부, R9700(32GB) 실측 가이드

title: 로컬 LLM 제대로 돌리려면 — VRAM이 전부, R9700(32GB) 실측 가이드 (단테랩스)

인포그래픽 요약

01핵심 개요

항목내용
채널단테랩스
한줄 요약로컬 LLM 성패는 그래픽카드 메모리(VRAM). 32GB R9700이 20~32B급 모델을 통째로 올려 요약·번역·짧은 에이전트에 '유능한 인턴' 수준. 프론티어 대체는 불가, 하이브리드가 정답

02장비 선택 우선순위

등급VRAM할 수 있는 일
맛보기8GB소형 모델 체험
가벼운 에이전트16~24GB단발 도구 호출(파일 생성·확인)
실용 에이전트32GB코드 작성→실행→테스트→버그수정 자율 완주
장시간 멀티턴48GB+대형 모델·긴 세션(추정)

03왜 32GB · R9700인가

체감 성능 상위 오픈웨이트(구글 Gemma 4 ~31B, 알리바바 Qwen 3.6 ~35B)를 4비트로 긴 컨텍스트까지 올리려면 딱 32GB가 필요. 32GB 소비자 카드는 R9700·5090·인텔 일부뿐이며 R9700이 가장 저렴(쿠팡 실거래 280~320만 원대). RTX 5080(16GB)은 20~32B가 안 올라감. 원시 성능은 5080의 85~90%지만 5090이 못 올리는 큰 모델을 소화. 5090 한 장 값이면 R9700 두 장(64GB) 구성 가능.

04MOE·양자화·VRAM 공식

  • Q4 양자화: 16비트를 4비트로 낮춰 용량 약 1/4. 폭과 품질의 스위트스팟.
  • 필요 VRAM ≈ 총 파라미터 ÷ 2 (32B → 약 16GB).
  • MOE 함정: 라마4 스카우트는 활성 17B지만 총 109B라 32GB에 못 올라감. 속도는 활성 파라미터가, 메모리는 총 파라미터가 결정.

05실측 결과

모델속도비고
Qwen3 30B MOE96 tok/s같은 크기 Dense(24 tok/s)의 4배
Qwen3 4B Dense125 tok/s소형
Qwen3 32B Dense25 tok/s커질수록 반비례 하락
70B급(42GB)4.2 tok/sVRAM 초과→CPU 오프로드 '절벽'

06한국어·라이선스

  • 원샷 한국어 품질 1위: EXAONE 4.1 32B(KMMLU 1위) — 단 비상업 라이선스, 답변 장황해 에이전트 부적합.
  • 한국어 에이전트: KANANA 2 30B(비상업), 상업 자유 원하면 Qwen 3.6 35B(Apache).
  • 요약·번역 전용: Konan 4B(162 tok/s, 도구 호출 불가).
  • 교훈: 벤치마크 1위 ≠ 실전 1위, 라이선스 반드시 확인.

07도구·구축(LM Studio)

LM Studio로 헤드리스 리눅스 서버에 CLI만으로 설치→모델 다운로드→ROCm 런타임→추론 서버(포트 1234, OpenAI 호환) 구동. LM Link로 VPN 없이 계정 로그인만으로 서버-맥-아이폰 연결, 원격 추론. 이후 Hermes 에이전트에 연동해 실사용 검증.

08결론 — 용도와 기대치

되는 것: 요약·번역·정보추출·분류·RAG·코딩 보조·짧은 에이전트. 안 되는 것: 아주 복잡한 장시간 멀티턴(컨텍스트 차오르면 성능 저하). 기대치는 '유능한 인턴 한 명'. 어려운 추론은 클라우드 프론티어, 민감·반복 업무는 로컬로 나누는 하이브리드 권장. 최대 메리트는 월 구독료·API 비용 없음.

09용어 사전

용어한줄 설명
VRAM(브램)그래픽카드 전용 메모리. 모델이 여기 통째로 올라가야 빠름
양자화(Q4)가중치 정밀도를 낮춰 용량 압축(JPG 압축과 유사)
MOE전문가 혼합. 질문마다 일부만 활성 → 빠르나 총 파라미터는 다 올려야 함
TTFT첫 토큰까지 걸리는 시간
오프로드VRAM 부족 시 일부 연산을 CPU로 넘김(속도 급락)
ROCmAMD GPU용 AI 연산 스택(엔비디아 CUDA 대응)
단테랩스 · 2026-07-04
← 목록으로