01핵심 개요 (표)
| 항목 | 내용 |
|---|---|
| 채널 | 안될공학 - IT 테크 신기술 (패치) |
| 핵심 주제 | M5 울트라의 통합 메모리 대역폭 향상과 로컬 AI 실사용성 |
| 핵심 수치 1 | 통합 메모리 대역폭 1.2TB/s (M3 울트라 800GB/s 대비 약 50% 향상) |
| 핵심 수치 2 | 최대 통합 메모리 용량은 512GB로 M3 울트라와 동일(용량 자체는 그대로) |
| 핵심 수치 3 | 다이 간 연결(울트라퓨전) 대역폭 4.4TB/s 이상, 연결 밀도 이전 대비 6배 이상 |
| 구조 변화 | M5 맥스 듀얼 다이 2세트를 묶은 M리즈 최초 4다이 구조 |
| 소프트웨어 생태계 | MLX(애플 실리콘용 오픈소스 ML 프레임워크) + MLX LM으로 오픈 모델을 빠르게 이식 |
| 비교 대상 | 데이터센터 HBM GPU(엔비디아)는 대규모 학습·다중 사용자 서버에서 여전히 우위 |
02핵심 기능/내용 구조
- 메모리 대역폭이 용량보다 중요해진 이유: M3 울트라도 이미 512GB까지 지원해 큰 모델을 "올리는" 것 자체는 가능했지만, 모델을 얼마나 빠르게 "쓸 수 있는지"는 별개 문제였다. 초당 두세 토큰으로는 몇 시간씩 돌리는 코딩 에이전트 작업에 속도 차이가 그대로 누적된다 (00:00).
- 프리필과 디코드의 구분: LLM 추론은 입력을 한 번에 병렬 처리하는 '프리필'(행렬 연산 성능에 좌우, M5세대 GPU 코어의 뉴럴 액셀러레이터가 담당)과, 답을 한 토큰씩 만드는 '디코드'(메모리 대역폭에 좌우)로 나뉜다. 코딩 에이전트는 코드·도구 실행 결과를 읽는 입력 토큰이 훨씬 많아 프리필 속도가 느리면 매번 긴 코드를 다시 읽는 데 시간을 낭비한다 (32:48 부근).
- 대역폭과 토큰 속도의 단순 계산: 양자화된 100GB 모델 가중치를 토큰 하나마다 한 번씩 훑는다고 가정하면, 800GB/s 대역폭에서는 이론상 초당 약 8번, 1.2TB/s에서는 약 12번 읽을 수 있다. 실제 토큰 수와 정확히 일치하진 않지만 대역폭 향상이 왜 중요한지 보여주는 근사치다 (03:00 부근).
- 4다이 울트라퓨전 구조: M5 울트라는 듀얼 다이 M5 맥스 2개를 차세대 울트라퓨전으로 묶은 M리즈 최초의 4다이 구조다. 다이를 쪼개면 제조엔 유리하지만 다이 간 통신이 느려지면 전체 성능이 떨어지므로, 패키징 단계에서 다이 간 고속 신호선 밀도를 6배 이상 높이고 다이 간 대역폭을 4.4TB/s 이상으로 끌어올렸다 (04:15 부근).
- MLX 생태계와 오픈 모델의 격차 축소: 과거엔 오픈AI·구글·앤트로픽 서버 모델과 개인이 받을 수 있는 모델의 성능 차이가 컸지만, 최근 Qwen3.8 27B 같은 멀티모달 모델이 공개 직후 MLX용 4비트/8비트 변환본과 스페큘레이티브 디코딩용 드래프트 모델까지 빠르게 나온다. 허깅페이스 MLX 커뮤니티에는 이미 수천 개 모델이 올라와 있다 (05:23 부근).
- 로컬 서버화: 올해 WWDC에서 MLX LM 서버로 오픈AI API와 호환되는 로컬 서버를 만드는 방법을 공개했다. 기존 코딩 에이전트의 API 주소만 로컬로 바꾸면 에이전트 입장에서는 모델이 클라우드에 있는지 맥 스튜디오에 있는지 신경 쓸 필요가 없어진다 (05:55 부근).
03기술적 맥락
애플 실리콘은 CPU와 GPU가 하나의 통합 메모리를 공유하는 구조로, 일반 PC의 시스템 램·GPU V램 분리 구조와 근본적으로 다르다. 맥 스튜디오는 GPU가 수백GB 통합 메모리 풀에 직접 접근할 수 있어 대형 모델을 로드하는 데 유리했다. 이번 M5 울트라는 여기에 더해 4다이 구조와 울트라퓨전 인터커넥트 강화로 다이 간 통신 병목을 줄이고, 통합 메모리 대역폭을 50% 끌어올려 "모델을 올릴 수 있다"에서 "모델을 빠르게 쓸 수 있다"로 넘어가는 하드웨어 조건을 갖췄다.
애플 자체 파운데이션 모델(3세대, 구글과 공동 개발)도 같은 메모리 병목 고민을 공유한다. 기기 내 모델과 프라이빗 클라우드 컴퓨트 서버 모델을 분리 운영하며, 가장 큰 온디바이스 모델은 약 200억 파라미터 규모다. 전체 가중치를 낸드(NAND)에 저장하고 요청에 필요한 전문가(MoE 방식)만 디램으로 가져오는 방식을 사용해, 느린 낸드와 빠른 디램 사이의 데이터 이동을 최소화하도록 설계했다.
04전략적 의미
애플 인텔리전스 초기에는 애플이 AI 경쟁에서 뒤처졌다는 평가가 지배적이었다. 그러나 자체 파운데이션 모델을 3세대까지 발전시키고, 구글과 협력해 외부 모델을 받아들이며, MLX를 통해 오픈 모델을 애플 실리콘으로 끌어오는 통로를 만들면서 상황이 달라졌다. 세상에 좋은 오픈 모델이 새로 나올수록 애플이 직접 학습하지 않아도 맥에서 할 수 있는 일이 함께 늘어나는 구조가 된 것이다. AI 모델 자체의 경쟁에서는 애플이 밀렸지만, "좋은 모델을 어떤 기기에서 얼마나 빠르고 편하게 오래 돌릴 수 있는가"로 경쟁의 축이 넓어지면 애플 실리콘 설계·통합 메모리 구조·macOS·개발 도구·MLX를 자체 플랫폼에 맞춰온 애플의 강점과 다시 맞물린다.
05핵심 워크플로우 또는 비교표
| 구분 | M3 울트라 | M5 울트라 |
|---|---|---|
| 다이 구조 | 듀얼 다이 M3 맥스 2개 결합 | M5 맥스(듀얼 다이) 2세트 → 4다이 |
| 통합 메모리 최대 용량 | 512GB | 512GB (동일) |
| 통합 메모리 대역폭 | 800GB/s대 | 1.2TB/s (약 50% 향상) |
| 다이 간 연결 밀도 | 기준 | 6배 이상 향상 |
| 다이 간 대역폭 | - | 4.4TB/s 이상 |
| 로컬 LLM 시사점 | 대형 모델 탑재는 가능, 실사용 속도는 제한적 | 디코드(토큰 생성) 속도 이론상 유의미하게 향상 |
06활용 시나리오
- 로컬 코딩 에이전트 장시간 운용: 프리필·디코드 속도가 모두 빨라지면 토큰 사용량을 신경 쓰지 않고 에이전트를 몇 시간씩 로컬에서 돌릴 수 있게 되어, API 비용과 외부 전송 우려 없이 장기 작업이 가능해진다.
- 민감 코드·문서의 완전 로컬 처리: 외부 서버로 보내기 꺼려지는 사내 코드나 문서를 클라우드 API 대신 맥 스튜디오 로컬 모델로 전량 처리하는 워크플로우.
- 오픈 모델 즉시 검증: 새 오픈 모델이 공개되면 MLX 커뮤니티의 4비트/8비트 변환본을 받아 곧바로 맥에서 성능·속도를 테스트하고, 필요하면 MLX LM 서버로 기존 에이전트 파이프라인에 즉시 연결.
- 스페큘레이티브 디코딩 실험: Qwen3.8 같은 모델에 MTP 드래프트 모델을 붙여 체감 응답 속도를 추가로 끌어올리는 구성.
07현황 및 전망
- M5 울트라는 메모리 용량(512GB) 자체는 M3 울트라와 동일하지만, 대역폭이 1.2TB/s로 50% 향상되어 로컬 LLM의 실질 사용성(토큰/초)을 개선할 잠재력이 크다.
- 오픈 모델과 MLX 생태계의 발전 속도가 빨라지면서, 클라우드 프런티어 모델과 로컬 실행 가능 모델 간의 성능 격차가 빠르게 줄고 있다.
- 데이터센터급 HBM 가속기(엔비디아 등)는 대규모 학습·다중 사용자 서빙에서 여전히 압도적이며, 맥 스튜디오의 강점은 "개인 한 명이 책상 위에서 대형 모델을 통째로 돌릴 수 있다"는 지점에 있다.
- 발표자는 512GB M5 울트라 구매를 고민 중이며, 구매 시 (1) 최대 오픈 모델의 디코드 속도(토큰/초), (2) MTP 드래프터 기반 스페큘레이티브 디코딩의 체감 향상, (3) 코딩 에이전트 장시간 로컬 운용 실사용성 세 가지를 직접 검증하고 싶다고 밝혔다.
- 애플은 자체 파운데이션 모델(3세대) 고도화, 구글과의 협력, MLX를 통한 오픈 모델 이식이라는 세 방향을 동시에 추진하며 로컬 AI 하드웨어·소프트웨어 통합 전략을 강화하는 모습이다.
08용어 사전
| 용어 | 설명 |
|---|---|
| 통합 메모리(Unified Memory) | CPU·GPU가 하나의 메모리 풀을 공유하는 애플 실리콘 구조 |
| 메모리 대역폭 | 초당 메모리를 읽고 쓸 수 있는 데이터량(GB/s, TB/s) |
| 프리필(Prefill) | LLM이 입력 프롬프트·문서를 한 번에 병렬 처리하는 추론 단계 |
| 디코드(Decode) | LLM이 답변을 한 토큰씩 순차 생성하는 추론 단계 |
| 울트라퓨전(UltraFusion) | 애플이 여러 다이를 하나의 프로세서처럼 묶는 패키징 인터커넥트 기술 |
| 다이(Die) | 실리콘 웨이퍼에서 잘라낸 개별 반도체 칩 조각 |
| MLX | 애플 머신러닝 연구팀이 만든 애플 실리콘 전용 오픈소스 ML 프레임워크 |
| 스페큘레이티브 디코딩 | 작은 드래프트 모델로 후보 토큰을 미리 생성해 큰 모델 검증으로 속도를 높이는 기법 |
| MoE(전문가 혼합) | 요청마다 전체 파라미터 중 일부 전문가만 활성화하는 모델 구조 |
| 양자화 | 모델 가중치의 정밀도를 낮춰(4비트·8비트 등) 용량과 연산량을 줄이는 기법 |
