안될공학MORNING DIGEST · 2026-08-12 · 안될공학🎬 영상

애플 AFM3, NAND를 모델 저장소로 — AI 시대 메모리 계층 재편

안될공학(패치)이 3세대 애플 파운데이션 모델 AFM3를 통해 온디바이스 AI가 메모리 구조를 어떻게 바꾸는지 분석. 애플은 200억 파라미터 모델 전체를 느린 NAND에 저장하고 필요한 전문가만 DRAM으로 불러오는 구조를 채택, IFP·양자화로 속도·용량을 잡았다. AI 데이터센터가 촉발한 메모리 가격 급등(모바일 LPDDR5X 2분기 78~83%↑) 속에서, DRAM과 NAND의 '역할 분담'이 AI 하드웨어의 핵심 화두로 부상했다는 것이 요지.

인포그래픽 요약

01배경 — 메모리 가격 급등과 애플의 선택

한 달 뒤 신형 아이폰 공개를 앞두고 메모리·저장공간이 관전 포인트. AI 데이터센터가 DRAM·NAND를 대량 흡수하며 2분기 모바일용 LPDDR5X가 전분기 대비 약 78~83% 상승. 팀 쿡도 "가격 상승을 더는 전부 흡수하기 어렵다"고 언급했고, 애플이 중국 CXMT(2025년 세계 DRAM 점유율 4위·약 7.7%)와 조달을 논의했다는 보도까지 나왔다. 이 시점에 애플은 아이폰 내 메모리 사용 방식을 크게 바꿨다.

02AFM3 구조 — NAND에 모델, DRAM에 활성 부분

AFM3에는 온디바이스 모델이 둘. AFM3 코어는 약 30억 파라미터 밀집(dense) 모델, 코어 어드밴스드는 전체 200억 파라미터지만 요청에 따라 10~40억만 활성화하는 MoE(전문가 혼합) 유사 구조. 어떤 전문가가 필요할지 모르므로 전체 모델은 어딘가 보관해야 하는데, 애플은 DRAM 대신 '저장용 NAND'를 모델 보관소로 끌어들였다. 전체 200억은 NAND에 두고 선택된 전문가만 DRAM으로 로드한다. 1월 애플·구글 공동발표대로 제미나이·구글 클라우드 기반 위에 애플 실리콘에 맞춰 재설계됐다.

03IFP — NAND의 느린 속도를 우회

NAND는 DRAM보다 훨씬 느려, 토큰마다 전문가를 바꿔 NAND를 읽으면 대기 시간이 병목이 된다. 애플의 해법은 IFP(instruction-following pruning): 사용자 질문을 먼저 보고 이 작업에 필요한 부분을 골라 NAND→DRAM으로 한 번 가져온 뒤, 토큰마다 갈아끼우지 않고 그대로 사용하며 정말 필요할 때만 다시 고른다. 표준 MoE가 토큰마다 전문가를 결정하는 것과 달리 '무엇을 계산할지 먼저 정해' 모델 읽기 횟수 자체를 줄이는 것이 핵심 차이.

04성능 — 작은 모델처럼 빠르게, 큰 모델처럼 정확하게

IFP 연구에서 90억 파라미터 모델이 질문마다 약 30억만 골라 쓰고도, 일반 30억 밀집 모델보다 수학·코딩에서 5~8포인트 높은 성능을 냈다. 동시에 첫 토큰 생성 시간은 30억 밀집 모델과 비슷한 수준 — 필요한 능력을 잘 골라내면 작은 모델의 속도로 큰 모델의 결과에 근접한다.

05NAND 수명·양자화 — 리드 헤비와 2비트

모델 가중치는 한 번 기록하면 대부분 읽기만 하는 리드 헤비 워크로드라 NAND에 상대적으로 적합. 다만 반복 리드는 주변 셀 문턱전압을 흔드는 '리드 디스터브' 오류를 키울 수 있는데, 한 번 가져온 가중치를 DRAM에 유지·재사용하는 구조가 이를 완화한다. 여기에 양자화가 결합 — 애플은 2025년 30억 모델에서 디코더 가중치를 2비트(임베딩 4비트, KV캐시 8비트)까지 낮췄고, QAT(양자화 인지 학습)+어댑터 재학습으로 품질 손실을 보완해 MMLU가 오히려 1.5% 상승. 30억을 16비트로 저장하면 약 6GB지만 2비트면 이론상 0.75GB.

06저장 용량 수요 폭증 — 아이폰이 NAND 시장에 미칠 힘

애플 인텔리전스 공식 요구 저장공간은 현재 7GB(끄면 모델 삭제). 트렌드포스는 2026년 플래그십에서 로컬 AI용 모델·캐시가 40~60GB 시스템 저장공간을 쓸 수 있다고 전망(언어·음성·이미지 모델+캐시 합산). 아이폰17이 기본 저장을 128→256GB로 올린 것도 이 맥락. 2025년 애플이 약 2.4억 대를 생산했으므로 대당 평균 64GB만 늘어도 추가 NAND 약 15.4엑사바이트, 128GB면 약 37엑사바이트 — 대당 한 단계가 2억 대를 만나면 NAND 업계에 큰 숫자가 된다.

07업계 공통 방향 — HBF·GEN-S와 메모리 계층화

AFM3는 특이 사례가 아니라 업계 흐름과 궤를 같이한다. SK하이닉스·샌디스크는 HBM과 SSD 사이 새 계층으로 NAND를 쓰는 HBF(High Bandwidth Flash) 표준화를 추진, 삼성전자도 FMS26에서 차세대 NAND 아키텍처 GEN-S 컨셉을 공개(AI 가속기 가까이 NAND 배치로 대용량 모델 고속 공급). PC에서도 온디바이스 모델·MS 리콜이 SSD를 점유. 결론: AI가 커질수록 DRAM/NAND 중 택일이 아니라 '지능 전체를 어디에 보관하느냐'가 중요해진다 — 계산할 부분은 DRAM/HBM, 거대한 모델·데이터는 NAND/HBF가 맡는 역할 분담.

08용어 사전

  • AFM3: 애플의 3세대 온디바이스 파운데이션 모델(코어 30억·코어 어드밴스드 200억).
  • MoE(전문가 혼합): 큰 모델 안 여러 전문가 중 질문에 필요한 것만 활성화하는 구조.
  • IFP(instruction-following pruning): 질문 단위로 필요한 가중치를 선별해 NAND 읽기 횟수를 줄이는 기법.
  • 양자화/QAT: 가중치를 2·4·8비트로 낮춰 용량·속도를 확보하는 압축과 그 인지 학습.
  • 리드 디스터브: 반복 읽기로 인접 NAND 셀의 문턱전압이 변해 생기는 오류.
  • HBF(High Bandwidth Flash): HBM과 SSD 사이를 메우는 고대역폭 NAND 계층.
안될공학 · 2026-08-12
← 목록으로