안될공학MORNING DIGEST · 2026-08-31 · 안될공학 - IT 테크 신기술🎬 영상
HBF, 성공 가능성 낮다? 말하지 않는 치명적 난제 — 발열·온도·낸드 신뢰성
안될공학(패치)이 삼성·SK하이닉스·샌디스크가 밀고 있는 차세대 메모리 HBF(High Bandwidth Flash)의 핵심 리스크를 짚는다. 대역폭 스펙보다 '낸드를 GPU 옆 뜨거운 곳에서 몇 년간 안정적으로 굴릴 수 있는가'가 진짜 관건이라는 주장이다.

01HBF란 무엇이 다른가
- 낸드를 HBM처럼 8~16단으로 수직 적층해 GPU 바로 옆에 붙이는 방식으로, 최대 512GB 용량·초당 수 테라바이트급 대역폭을 노린다.
- 문제는 기존 컴퓨터가 낸드(SSD)를 연산칩에서 일부러 멀리 떨어뜨려 온도를 관리해온 것과 정반대로, HBF는 낸드를 뜨거운 연산 영역 바로 옆에 두고 사용 패턴도 저장용에서 '작업 메모리'에 가깝게 바꾼다는 점이다.
- 실측 사례(DGX 스파크 계열)로 보면 같은 워크로드에서 GPU 80~82도, CPU 87~88도인데 SSD는 52~63도로 20도 이상 차이가 난다 — 이 간격을 HBF는 작은 패키지 안에서 다시 만들어내야 한다.
02온도가 뒤흔드는 낸드 신뢰성 3요소
- 리텐션(보존): 셀 안 전자가 시간이 지나며 이동하는데, 온도가 높을수록 이 변화가 빨라져 저장값 판별이 어려워진다. 클라이언트 SSD 규격 기준 30도 1년 보존을 시험하려면 52도 500시간, 66도 96시간으로 압축 시험한다.
- 리드 디스터브: 같은 셀을 반복해서 읽으면 주변 셀 값이 흔들리는 현상. 2025년 연구에서 접근 패턴에 따라 ECC 한계까지 가는 횟수가 약 5만4,560회~51만8,420회로 10배 가까이 차이 났다.
- 엔듀런스(쓰기 수명): 프로그램-지우기(P/E) 사이클이 누적될수록 오류가 늘지만, 온도와의 관계는 리텐션만큼 단순하지 않다(일부 조건에서는 고온이 오히려 오류 특성이 낫기도 했다).
- 세 지표는 서로 얽혀 있다 — 리텐션이 줄면 컨트롤러가 데이터를 더 자주 재기록해야 하고, 그 관리 쓰기가 늘수록 실질 엔듀런스가 더 빨리 소모된다.
03SLC 회귀 — 왜 다시 '싼 걸 포기'하는가
- SSD 업계는 SLC→TLC→QLC로 한 셀에 더 많은 비트(2단→8단→16단 눈금)를 넣어 용량 대비 가격을 낮춰왔다.
- 그런데 최근 HBF 연구(플린트, 플래시 엑셀 등)는 오히려 SLC를 전제로 설계된다 — 판독 여유가 넓고 빠르며 반복 쓰기에도 유리하기 때문. 대신 16단 적층+TSV 본딩이 필요해 SSD의 TLC/QLC 가격 수준은 기대하기 어렵다.
- 즉 'HBM보다 용량당 비용이 쌀 가능성'과 'SSD만큼 싸다'는 서로 다른 이야기로 구분해야 한다.
04컨트롤러·베이스다이가 진짜 승부처
- HBF에서는 GPU가 데이터를 기다리는 구조상 기존 SSD처럼 여러 번 재시도·강한 오류보정을 반복하면 자랑하는 마이크로초급 접근 시간이 무너진다 — 그만큼 문제를 사전에 줄이는 컨트롤러 설계 비중이 커진다.
- 최신 HBF 풀스택 연구는 16단 낸드의 열을 모델링해 뜨거운 플레인 사용을 제한하고 트래픽을 분산하는 '열 인지 스케줄링'을 적용한다.
- 삼성은 하이칩스 2026에서 HBM 베이스다이에 메모리 컨트롤러·S램 기반 리페어·온도/전압 센서를 넣고, '히트패스 블록' 구조로 피크 온도를 35% 이상 낮췄다고 밝혔다(HBM 기준 발표지만 HBF 컨트롤러 설계 방향성을 시사).
05리드 온리에 가까운 사용법으로 수렴 중
- 린트(Lint) 연구는 모델 웨이트를 배포 시 한 번 기록하고 추론 중엔 거의 다시 쓰지 않는다고 가정, 일반 SSD의 FTL 대신 단순화한 'Read-only FTL'을 쓴다.
- SK하이닉스 초기 자료의 'KV캐시 프로세싱'은 범위가 넓었지만, H3 논문의 실제 설계는 미리 계산된(공유) KV캐시만 HBF에 두고 실시간으로 계속 생기는 동적 KV캐시는 HBM에 남기는 제한적 방식이다.
- 실제 서비스 데이터 연구에서도 실시간 KV캐시를 HBF로 내리면 '읽기보다 쓰기가 많은(라이트 헤비)' 부담스러운 패턴이 나타났다 — 리드 온리 설계가 편의가 아니라 신뢰성 확보를 위한 선택임을 뒷받침한다.
06시사점 — 봐야 할 스펙이 다르다
- 실제 서비스 환경에서는 모델이 자주 교체되는데, HBF 구조(HBM처럼 다이투다이 결합)는 SSD처럼 낸드만 쉽게 뽑아 교체하기 어렵다 — 낸드 신뢰성이 곧 비싼 가속기 보드 수명과 직결된다.
- 저자는 향후 HBF 제품을 볼 때 '초당 몇 테라바이트' 대신 사용 낸드 셀 종류, 보장 P/E 사이클, 고온 데이터 보존 기간, 반복 읽기 시 재기록 시점, 수년간 모델 교체를 반복해도 초기 성능을 유지하는지를 봐야 한다고 제안한다.
- 결론적으로 HBF 경쟁은 '몇 단을 쌓았는가'가 아니라 낸드 셀 자체의 리텐션·엔듀런스·리드디스터브 품질과, 이를 정확히 읽고 제어하는 베이스다이 컨트롤러 역량이 함께 결정한다.