조코딩 JoCodingYOUTUBE SUMMARIES · 2026-09-22 · 조코딩 JoCoding🎬 영상
M5 울트라·M3 울트라 맥 스튜디오 연결로 로컬 AI 성능과 한계를 시험했다.
M5·M3 울트라 2대를 RDMA로 묶어 512GB 로컬 AI 구동 성능을 시험했다.
01핵심 개요
- M5 울트라 256GB와 M3 울트라 256GB 맥 스튜디오를 썬더볼트 5로 연결해 512GB 통합 메모리 환경을 구성했다.
- M5 울트라 36코어 CPU·80코어 GPU·4TB 저장장치 구성의 안내 가격은 2,100만 원으로 소개됐다.
- Qwen 3.8 27B 측정에서 M5 울트라 단독 생성은 19.8토큰/초, M5·M3 RDMA 연결은 23.2토큰/초였다.
- 입력 처리 단계인 프리필은 M5 울트라가 1,272토큰/초로 M3 울트라의 371토큰/초보다 크게 높았다.
- H3 MLX 최적화 버전은 M5 울트라 한 대에서 5초 영상 생성에 121초가 걸렸고, 최대 메모리 약 8GB를 사용했다.
02핵심 주장 / 논점 구조
- 대용량 통합 메모리를 활용하면 소비자용 GPU 메모리로 올리기 어려운 대형 오픈 웨이트 모델을 로컬에서 구동할 수 있다는 점을 시험했다.
- 두 대 연결의 핵심 목적은 작은 모델의 단순 가속보다, 단일 장비 메모리에 들어가지 않는 GLM 5.3·DeepSeek V4.1 Flash급 모델을 올리는 데 있다.
- M5 울트라와 M3 울트라의 혼합 연결은 가능하지만, 텐서 병렬 처리에서 M3 울트라가 프리필 성능의 병목이 될 수 있다고 설명했다.
- 로컬 구동의 장점으로 데이터가 클라우드로 나가지 않는 보안성과 API 토큰 대신 전기료를 내는 비용 구조를 들었다.
03장비 구성과 출시·가격 정보
- 방송 장비는 M5 울트라 맥 스튜디오 256GB 한 대와 M3 울트라 맥 스튜디오 한 대이며, 두 장비의 통합 메모리를 합쳐 512GB 환경으로 구성했다.
- M5 울트라 장비는 36코어 CPU, 80코어 GPU, 256GB 통합 메모리, 4TB 저장장치 구성으로 소개됐다.
- 해당 M5 울트라 구성의 견적은 2,100만 원으로 제시됐으며, 최대 512GB 통합 메모리 모델은 10월 하순 출시 예정이라고 언급됐다.
- 애플이 리뷰 조건으로 장비를 대여했으며, 장비는 추후 반납해야 한다고 밝혔다.
04썬더볼트 5·RDMA 연결 방식
- 두 맥 스튜디오는 썬더볼트 5 케이블로 연결했고, 클로드 코드의 안내를 따라 설정 및 재부팅을 거쳐 연결을 구성했다고 설명했다.
- 비교 구성으로 M5 울트라 단독, M3 울트라 단독, 두 대 텐서 병렬, RDMA 연결 방식을 언급했다.
- RDMA는 CPU나 운영체제 개입 없이 네트워크상 다른 컴퓨터의 메모리를 직접 읽고 쓰는 고속 통신 기술로 소개됐다.
- 방송 중 리포트는 RDMA가 없으면 두 장비를 묶는 의미가 작다고 설명했고, 연결 대역폭은 80GB/초로 언급됐다.
05Qwen 3.8 27B 벤치마크 결과
- 51GB 크기의 Qwen 3.8 27B 모델을 기준으로 M5 울트라 단독과 M3 울트라 및 연결 구성을 비교했다.
- M5 울트라 단독의 생성 속도는 19.8토큰/초, 메모리 사용량은 54.9GB로 측정됐다고 소개됐다.
- M3 울트라 단독은 생성 13.6토큰/초, 프리필 371토큰/초로 제시됐고, M5 울트라의 프리필은 1,272토큰/초였다.
- M5·M3 울트라를 RDMA로 연결한 생성 속도는 23.2토큰/초로, M5 단독보다 높지만 두 배 수준의 향상은 아니었다.
06프리필·디코드 병목과 혼합 클러스터 특성
- 프리필은 LLM이 답변 전 프롬프트 전체를 읽고 결과를 KV 캐시에 저장하는 단계이며, 첫 글자가 나오기까지의 대기 시간에 영향을 준다고 설명했다.
- 디코드는 토큰을 하나씩 생성하는 단계로, 모델 가중치 전체를 반복해 읽으므로 메모리 대역폭 병목의 영향을 받는다고 소개됐다.
- 생성은 메모리 대역폭 경쟁이라 장비를 나누면 빨라질 수 있지만, 프리필은 연산 경쟁이라 M3 울트라가 M5 울트라의 발목을 잡는다고 정리했다.
- 짧은 입력과 긴 답변의 채팅은 두 대 연결이 유리할 수 있으나, 긴 문서나 코드를 넣는 작업은 M5 울트라 단독이 더 빠를 수 있다고 설명했다.
07대형 모델·로컬 운용의 가능성
- DeepSeek V4.1 Flash는 483GB를 사용하므로 512GB 환경에서 간신히 동작할 수 있는 모델로 언급됐다.
- GLM 5.3은 4비트 양자화 모델을 내려받아 두 대에 올리려 했으며, 4비트 양자화 성능은 원본의 약 94% 수준이라는 자료를 소개했다.
- GLM 5.3의 두 장비 텐서 병렬 측정은 초기에는 실패했으며, 방송에서는 로그 저장 문제를 원인으로 언급했다.
- 여러 대 연결은 이론상 제한이 없다는 정보를 소개했지만, 통신·동기화 병목 때문에 실사용에서는 2~4대 구성이 안정적이라고 전했다.
- H3 영상 생성과 전력비 추정: H3는 MLX 최적화 패키지로 내려받아 M5 울트라 한 대에서 구동했으며, 생성 중 M3 울트라는 사용되지 않았다.
- H3 영상 생성과 전력비 추정: 골든 리트리버가 석양 해변을 달리는 5.2초 영상 생성은 약 121초가 걸렸고, 영상과 소리가 출력됐다.
- H3 영상 생성과 전력비 추정: H3 생성 과정에서 GPU 사용률은 높게 나타났고, 프로세스 최대 메모리는 약 8GB로 표시됐다고 설명했다.
- H3 영상 생성과 전력비 추정: 두 맥 스튜디오를 24시간 추론에 사용할 때 전기료는 하루 약 2,500~3,100원, 한 달 약 8~9만 원으로 추정됐다.
08용어 사전
| 용어 | 뜻 |
|---|
| 통합 메모리 | CPU와 GPU가 공유하는 메모리로, 방송에서는 두 장비 연결을 통해 총 512GB 환경을 구성하는 기반으로 사용됐다. |
| RDMA | CPU·운영체제 개입 없이 네트워크로 연결된 다른 컴퓨터의 메모리에 직접 접근하는 고속 통신 기술로 설명됐다. |
| 텐서 병렬 | 모델 연산을 두 맥에 나눠 처리하는 방식이며, 혼합 세대 구성에서는 느린 M3 울트라가 프리필 병목이 될 수 있다. |
| 프리필 | LLM이 입력 프롬프트 전체를 병렬 계산하고 KV 캐시에 저장하는 단계로, 첫 토큰 대기 시간과 관련된다. |
| 디코드 | LLM이 답변 토큰을 하나씩 생성하는 단계로, 모델 가중치를 반복해 읽어 메모리 대역폭 영향을 받는다고 설명됐다. |
| MLX | 방송에서 H3와 MiniMax 모델용 패키지가 언급된 맥 환경의 모델 구동 패키지 형태다. |