안될공학MORNING DIGEST · 2026-08-30 · 안될공학 - IT 테크 신기술🎬 영상

최강 GPU도 HBM 없으면 느려진다 | AI 시대 메모리가 주인공이 된 이유

'패치의 칩문학' 2편 — 폰 노이만 구조의 오랜 병목인 메모리 벽이 AI 시대에 왜 HBM이라는 해법으로 진화했는지 원리부터 짚는다.

인포그래픽 요약

01메모리 벽이란

  • 계산장치(CPU/GPU)와 저장장치(D램)가 분리된 폰 노이만 구조는 태생적으로 "데이터가 도착 안 하면 계산기가 논다"는 약점을 가진다 — 1995년 논문 'Hitting the Memory Wall'에서 이미 경고된 문제.
  • 기존엔 캐시(L1~L3)와 데이터 지역성(locality)으로 이 벽을 숨겨왔지만, 수백GB에 달하는 AI 모델 가중치는 온칩 캐시에 담을 수 없고 재사용 패턴도 캐시 감당 범위를 넘어선다.

02GPU의 해법 — 지연시간을 숨기는 병렬성

  • GPU는 수천 개 연산유닛이 동시에 도는 만큼 데이터 공급 통로(대역폭)도 함께 넓어야 한다. 한 워프가 메모리를 기다리는 동안 다른 워프를 실행해 지연시간을 숨기지만, 메모리 채널 자체가 포화되면 성능은 계산기 수가 아니라 데이터 공급량으로 결정된다.

03HBM의 원리 — 핀 속도가 아니라 연결 면적

1024개HBM3 입출력 통로 수
2048개HBM4 입출력 통로 수(2배)
  • HBM이 빠른 이유는 셀 하나하나가 빨라서가 아니라 GPU 바로 옆에 압도적으로 많은 연결선을 만들어 한꺼번에 데이터를 보내기 때문 — TSV(실리콘관통전극)로 디램을 수직으로 쌓아 층간을 직접 연결.
  • GPU-HBM 사이 수천 개 신호를 잇는 인터포저, 이를 패키징하는 TSMC 코워스(CoWoS) 등 첨단 패키징 능력이 부족하면 GPU·HBM이 준비돼도 완제품이 나올 수 없다.
  • HBM 제조는 정상 다이(KGD) 선별과 손상 없는 적층이라는 이중 난도의 싸움 — 적층 정렬이 어긋나거나 접점 일부만 붙지 않아도 전체 스택이 불량 처리된다.

04왜 지금 병목이 폭발했나 — 연산강도와 루프라인

  • 연산강도(1바이트당 계산 횟수)가 낮으면 메모리 대역폭이 병목이 된다. AI칩이 FP8/FP4 저정밀 연산으로 계산 성능을 급격히 높이면서, 루프라인 모델의 경계가 오른쪽(메모리 병목 쪽)으로 이동 — 예전엔 계산이 병목이던 작업이 이제 메모리에 먼저 막힌다.
  • 특히 LLM 추론의 디코드 단계(토큰 생성)에서 두드러진다 — 배치가 작으면 가중치 재사용률이 낮아 매번 거대한 가중치를 읽고 적은 계산만 하는 'weight streaming' 현상 발생. HBM 대역폭 1TB/s, 가중치 100GB 가정 시 이론상 초당 약 10토큰이 상한.

05계층화되는 AI 메모리

  • 최신 시스템은 HBM 외에도 CPU 쪽 소캠(SOCAMM), CXL 메모리, SSD를 계층적으로 활용 — 엔비디아 베라 루빈도 CPU LPDDR5X와 GPU HBM4를 NVLink C2C로 연결하고 KV캐시 일부를 CPU 메모리로 옮긴다.
  • HBM4에서 베이스 다이는 단순 받침대가 아니라 고객 맞춤 로직칩에 가까워짐 — 삼성은 자체 파운드리 4나노 베이스다이, SK하이닉스는 TSMC 협업 확대로 차별화.

062026년 HBM4 경쟁 스냅샷

3.3TB/s삼성 HBM4 스택당 최대 대역폭(2월 양산)
40%+SK하이닉스 HBM4 전력효율 개선(전세대 대비)
16GB/s삼성·SK하이닉스 HBM4E 샘플 공통 제시 속도(5·6월)
  • 삼성은 최신 공정의 성능 헤드룸, SK하이닉스는 축적된 적층 경험을 각각 앞세우며 우열을 가리기 어려운 경쟁 구도. SK하이닉스-엔비디아, 삼성-브로드컴 협력 발표 등 HBM 경쟁은 메모리사 단독전이 아닌 시스템 전체 경쟁으로 바뀌고 있다.
안될공학 · 2026-08-30
← 목록으로