안될공학 - IT 테크 신기술YOUTUBE SUMMARIES · 2026-09-13 · 안될공학 - IT 테크 신기술🎬 영상
엔비디아의 해자는 GPU 성능을 넘어 CUDA·네트워크·시스템 통합에 있다.
엔비디아의 해자는 GPU 자체보다 CUDA·NVLink·멜라녹스로 묶은 AI 시스템이다.
01핵심 개요
- 엔비디아는 2019년 멜라녹스를 약 69억 달러에 인수하겠다고 발표했고, 거래는 2020년 완료됐다.
- CUDA는 그래픽 명령으로 우회하던 GPU 범용 계산을 C·C++에 가까운 방식으로 활용하게 한 플랫폼이다.
- 여러 GPU 학습에서는 그레디언트를 합쳐 다시 배포하는 올리듀스와 통신 라이브러리 NCCL이 필요하다.
- NVLink·NVSwitch는 랙 안 GPU를 고속 연결하고, 인피니밴드·RDMA는 서버 간 데이터 이동의 CPU 개입을 줄인다.
- DGX는 GPU 8장과 NVLink, CPU·저장장치·딥러닝 소프트웨어를 검증된 시스템으로 묶은 제품이다.
02핵심 주장 / 논점 구조
- 영상은 엔비디아의 경쟁력이 GPU 한 장의 연산 성능보다 GPU가 쉬지 않고 일하도록 만드는 시스템에 있다고 설명한다.
- 강한 GPU는 CUDA 생태계와 연결 기술의 기반이지만, GPU 한 장만으로 수천 장 규모 학습을 수행할 수는 없다고 짚는다.
- 핵심은 GPU가 메모리·다른 GPU·CPU·네트워크를 기다리는 시간을 줄이고 계산 시간을 늘리는 구조다.
- 소프트웨어, 메모리, GPU 간 통신, 서버 간 네트워크, 랙 설계가 서로의 가치를 높이는 것이 시스템 해자라는 결론이다.
03GPU 병렬 연산과 CUDA의 형성
- 풀 HD 화면은 한 장에 200만 개가 넘는 픽셀로 구성되며, 60프레임은 매초 60장의 화면을 새로 계산해야 한다.
- GPU는 복잡하고 예외가 많은 일을 처리하는 CPU와 달리, 비슷한 계산을 대량으로 나눠 처리하도록 발전했다.
- 초기 연구자는 과학 계산을 색이나 위치 정보로 바꾸고 그래픽 명령으로 처리해야 했으며, 범용 작업 지시 체계가 부족했다.
- 스탠퍼드대에서 GPU 범용 계산을 연구한 이안 버크 팀의 브룩 연구는 엔비디아가 2004년 이안을 영입한 뒤 CUDA 흐름으로 이어졌다.
- CUDA는 GPU를 병렬 프로세서로 새로 만든 것이 아니라, 기존 병렬 능력을 그래픽 밖의 계산에도 쓰게 한 플랫폼으로 설명된다.
04CUDA 생태계와 AI 연구 플랫폼
- CUDA에는 코드를 GPU 실행용으로 바꾸는 컴파일러, 디버거, 성능 분석 도구와 최적화 라이브러리가 포함된다.
- 행렬 곱은 데이터 분할, 메모리 접근 순서, 연산기 공급 방식에 따라 속도가 크게 달라 AI용 최적화 라이브러리가 중요하다.
- 파이토치와 텐서플로 같은 프레임워크가 CUDA 라이브러리를 사용하면서 개발자는 CUDA 코드를 직접 쓰지 않고도 엔비디아 GPU를 활용하게 됐다.
- 2012년 알렉스넷은 G포스 GTX 580 두 장으로 학습돼 이미지넷에서 큰 성능 차이를 만들었다.
- AI 연구가 급증할 당시 엔비디아는 병렬 연산 하드웨어와 연구자가 사용할 CUDA를 함께 갖춘 계산 플랫폼이었다.
05다중 GPU 학습과 NCCL 통신
- 학습 메모리에는 모델 파일뿐 아니라 입력 데이터, 중간 결과, 모델 숫자 수정 방향을 계산하는 값도 들어가 모델 크기보다 커질 수 있다.
- 모델이 GPU 한 장에 들어가지 않으면 모델을 여러 GPU에 나누거나 복제한 뒤 학습 데이터를 나눠 처리해야 한다.
- 각 GPU가 계산한 수정 방향인 그레디언트를 합친 후 동일한 결과를 다시 배포해야 같은 모델을 유지할 수 있다.
- 올리듀스는 여러 GPU의 값을 합쳐 모든 GPU에 전달하는 연산이며, 먼저 계산을 마친 GPU도 다른 값이 도착할 때까지 기다린다.
- NCCL은 링·트리 등 데이터 크기, GPU 수, 서버 연결 구조에 맞춰 여러 GPU의 통신 순서를 관리하는 엔비디아 라이브러리다.
06NVLink와 멜라녹스 기반 확장 구조
- PCI 익스프레스는 여러 장치를 연결하는 범용 규격이지만, 대규모 AI 학습에서는 GPU 간 대량 데이터 교환이 반복된다.
- NVLink는 GPU 사이 전용 고속 통로이고, NVSwitch는 많은 GPU 통로를 연결하는 교환 장치로 소개된다.
- 한 서버나 랙 안에서 GPU를 매우 빠르게 묶는 것은 스케일업이며, 여러 서버와 랙을 클러스터로 묶는 것은 스케일아웃이다.
- 엔비디아는 랙 밖 연결에 필요한 기술을 위해 인피니밴드와 고성능 이더넷 어댑터·스위치 기술을 보유한 멜라녹스를 인수했다.
- RDMA와 GPU Direct RDMA는 네트워크 장치가 상대 시스템 메모리 및 GPU 메모리까지 직접 연결해 CPU 개입과 데이터 이동 대기 시간을 줄인다.
07DGX 통합 시스템과 맞춤형 칩의 공존
- 엔비디아는 2016년 DGX-1을 공개하며 GPU 8장, NVLink, CPU, 저장장치, 딥러닝 소프트웨어를 검증된 시스템으로 묶었다.
- DGX는 고객이 여러 회사 부품을 직접 조합하고 성능 저하 원인을 찾는 대신, 엔비디아가 정한 기준 시스템에서 시작하게 한다.
- HBM은 GPU 옆에서 데이터를 공급하고, NVLink·NVSwitch는 랙 안 GPU를 묶으며, 인피니밴드·고성능 이더넷은 서버와 랙 사이를 연결한다.
- 구글·아마존·마이크로소프트가 자체 CPU와 AI 가속기를 만들자, 엔비디아는 맞춤형 CPU·가속기도 NVLink 및 랙 구조에 결합하는 NVLink Fusion 전략을 내놓았다.
- 구글 TPU, 아마존 트레이니움, 마이크로소프트 마이아, 메타의 자체 가속기는 반복되는 특정 작업에 맞춰 비용과 전력 효율을 높이려는 움직임으로 설명된다.
08용어 사전
| 용어 | 뜻 |
|---|
| CUDA | 컴파일러·디버거·성능 분석 도구·라이브러리를 통해 개발자 코드가 엔비디아 GPU에서 실행되도록 하는 플랫폼이다. |
| NCCL | 여러 GPU가 그레디언트 등의 값을 주고받는 순서를 링·트리 방식 등으로 관리하는 엔비디아 통신 라이브러리다. |
| 올리듀스 | 여러 GPU가 계산한 값을 합친 뒤 동일한 결과를 모든 GPU에 다시 전달해 같은 모델을 유지하는 연산이다. |
| NVLink | 대규모 AI 학습에서 GPU 사이 대량 데이터를 반복 교환하기 위해 만든 엔비디아의 전용 고속 연결 통로다. |
| RDMA | 네트워크 장치가 상대 시스템 메모리와 직접 데이터를 교환해 CPU 개입과 복사 단계를 줄이는 기술이다. |
| DGX | GPU 8장, NVLink, CPU, 저장장치, 딥러닝 소프트웨어를 검증된 구성으로 묶은 엔비디아 시스템 제품이다. |