안될공학 - IT 테크 신기술YOUTUBE SUMMARIES · 2026-09-13 · 안될공학 - IT 테크 신기술🎬 영상

엔비디아의 해자는 GPU 성능을 넘어 CUDA·네트워크·시스템 통합에 있다.

엔비디아의 해자는 GPU 자체보다 CUDA·NVLink·멜라녹스로 묶은 AI 시스템이다.

01핵심 개요

  • 엔비디아는 2019년 멜라녹스를 약 69억 달러에 인수하겠다고 발표했고, 거래는 2020년 완료됐다.
  • CUDA는 그래픽 명령으로 우회하던 GPU 범용 계산을 C·C++에 가까운 방식으로 활용하게 한 플랫폼이다.
  • 여러 GPU 학습에서는 그레디언트를 합쳐 다시 배포하는 올리듀스와 통신 라이브러리 NCCL이 필요하다.
  • NVLink·NVSwitch는 랙 안 GPU를 고속 연결하고, 인피니밴드·RDMA는 서버 간 데이터 이동의 CPU 개입을 줄인다.
  • DGX는 GPU 8장과 NVLink, CPU·저장장치·딥러닝 소프트웨어를 검증된 시스템으로 묶은 제품이다.

02핵심 주장 / 논점 구조

  • 영상은 엔비디아의 경쟁력이 GPU 한 장의 연산 성능보다 GPU가 쉬지 않고 일하도록 만드는 시스템에 있다고 설명한다.
  • 강한 GPU는 CUDA 생태계와 연결 기술의 기반이지만, GPU 한 장만으로 수천 장 규모 학습을 수행할 수는 없다고 짚는다.
  • 핵심은 GPU가 메모리·다른 GPU·CPU·네트워크를 기다리는 시간을 줄이고 계산 시간을 늘리는 구조다.
  • 소프트웨어, 메모리, GPU 간 통신, 서버 간 네트워크, 랙 설계가 서로의 가치를 높이는 것이 시스템 해자라는 결론이다.

03GPU 병렬 연산과 CUDA의 형성

  • 풀 HD 화면은 한 장에 200만 개가 넘는 픽셀로 구성되며, 60프레임은 매초 60장의 화면을 새로 계산해야 한다.
  • GPU는 복잡하고 예외가 많은 일을 처리하는 CPU와 달리, 비슷한 계산을 대량으로 나눠 처리하도록 발전했다.
  • 초기 연구자는 과학 계산을 색이나 위치 정보로 바꾸고 그래픽 명령으로 처리해야 했으며, 범용 작업 지시 체계가 부족했다.
  • 스탠퍼드대에서 GPU 범용 계산을 연구한 이안 버크 팀의 브룩 연구는 엔비디아가 2004년 이안을 영입한 뒤 CUDA 흐름으로 이어졌다.
  • CUDA는 GPU를 병렬 프로세서로 새로 만든 것이 아니라, 기존 병렬 능력을 그래픽 밖의 계산에도 쓰게 한 플랫폼으로 설명된다.

04CUDA 생태계와 AI 연구 플랫폼

  • CUDA에는 코드를 GPU 실행용으로 바꾸는 컴파일러, 디버거, 성능 분석 도구와 최적화 라이브러리가 포함된다.
  • 행렬 곱은 데이터 분할, 메모리 접근 순서, 연산기 공급 방식에 따라 속도가 크게 달라 AI용 최적화 라이브러리가 중요하다.
  • 파이토치와 텐서플로 같은 프레임워크가 CUDA 라이브러리를 사용하면서 개발자는 CUDA 코드를 직접 쓰지 않고도 엔비디아 GPU를 활용하게 됐다.
  • 2012년 알렉스넷은 G포스 GTX 580 두 장으로 학습돼 이미지넷에서 큰 성능 차이를 만들었다.
  • AI 연구가 급증할 당시 엔비디아는 병렬 연산 하드웨어와 연구자가 사용할 CUDA를 함께 갖춘 계산 플랫폼이었다.

05다중 GPU 학습과 NCCL 통신

  • 학습 메모리에는 모델 파일뿐 아니라 입력 데이터, 중간 결과, 모델 숫자 수정 방향을 계산하는 값도 들어가 모델 크기보다 커질 수 있다.
  • 모델이 GPU 한 장에 들어가지 않으면 모델을 여러 GPU에 나누거나 복제한 뒤 학습 데이터를 나눠 처리해야 한다.
  • 각 GPU가 계산한 수정 방향인 그레디언트를 합친 후 동일한 결과를 다시 배포해야 같은 모델을 유지할 수 있다.
  • 올리듀스는 여러 GPU의 값을 합쳐 모든 GPU에 전달하는 연산이며, 먼저 계산을 마친 GPU도 다른 값이 도착할 때까지 기다린다.
  • NCCL은 링·트리 등 데이터 크기, GPU 수, 서버 연결 구조에 맞춰 여러 GPU의 통신 순서를 관리하는 엔비디아 라이브러리다.

06NVLink와 멜라녹스 기반 확장 구조

  • PCI 익스프레스는 여러 장치를 연결하는 범용 규격이지만, 대규모 AI 학습에서는 GPU 간 대량 데이터 교환이 반복된다.
  • NVLink는 GPU 사이 전용 고속 통로이고, NVSwitch는 많은 GPU 통로를 연결하는 교환 장치로 소개된다.
  • 한 서버나 랙 안에서 GPU를 매우 빠르게 묶는 것은 스케일업이며, 여러 서버와 랙을 클러스터로 묶는 것은 스케일아웃이다.
  • 엔비디아는 랙 밖 연결에 필요한 기술을 위해 인피니밴드와 고성능 이더넷 어댑터·스위치 기술을 보유한 멜라녹스를 인수했다.
  • RDMA와 GPU Direct RDMA는 네트워크 장치가 상대 시스템 메모리 및 GPU 메모리까지 직접 연결해 CPU 개입과 데이터 이동 대기 시간을 줄인다.

07DGX 통합 시스템과 맞춤형 칩의 공존

  • 엔비디아는 2016년 DGX-1을 공개하며 GPU 8장, NVLink, CPU, 저장장치, 딥러닝 소프트웨어를 검증된 시스템으로 묶었다.
  • DGX는 고객이 여러 회사 부품을 직접 조합하고 성능 저하 원인을 찾는 대신, 엔비디아가 정한 기준 시스템에서 시작하게 한다.
  • HBM은 GPU 옆에서 데이터를 공급하고, NVLink·NVSwitch는 랙 안 GPU를 묶으며, 인피니밴드·고성능 이더넷은 서버와 랙 사이를 연결한다.
  • 구글·아마존·마이크로소프트가 자체 CPU와 AI 가속기를 만들자, 엔비디아는 맞춤형 CPU·가속기도 NVLink 및 랙 구조에 결합하는 NVLink Fusion 전략을 내놓았다.
  • 구글 TPU, 아마존 트레이니움, 마이크로소프트 마이아, 메타의 자체 가속기는 반복되는 특정 작업에 맞춰 비용과 전력 효율을 높이려는 움직임으로 설명된다.

08용어 사전

용어뜻
CUDA컴파일러·디버거·성능 분석 도구·라이브러리를 통해 개발자 코드가 엔비디아 GPU에서 실행되도록 하는 플랫폼이다.
NCCL여러 GPU가 그레디언트 등의 값을 주고받는 순서를 링·트리 방식 등으로 관리하는 엔비디아 통신 라이브러리다.
올리듀스여러 GPU가 계산한 값을 합친 뒤 동일한 결과를 모든 GPU에 다시 전달해 같은 모델을 유지하는 연산이다.
NVLink대규모 AI 학습에서 GPU 사이 대량 데이터를 반복 교환하기 위해 만든 엔비디아의 전용 고속 연결 통로다.
RDMA네트워크 장치가 상대 시스템 메모리와 직접 데이터를 교환해 CPU 개입과 복사 단계를 줄이는 기술이다.
DGXGPU 8장, NVLink, CPU, 저장장치, 딥러닝 소프트웨어를 검증된 구성으로 묶은 엔비디아 시스템 제품이다.
안될공학 - IT 테크 신기술 · 2026-09-13
← 목록으로