Network & Server Factory

개인 공부 기록

AI/인프라

[NVIDIA] DGX와 HGX 사양 비교

1nfra 2026. 9. 26. 01:09
HGX는 GPU 8개와 NVLink Switch를 보드 하나에 올린 플랫폼이고, DGX는 NVIDIA가 이 보드로 직접 만든 완성품 서버입니다. 같은 세대라면 GPU 성능은 같고, 차이는 누가 서버를 만들고 지원하느냐입니다. GPU 72개를 하나의 NVLink 도메인으로 묶는 GB300 NVL72부터는 서버가 아니라 랙이 한 단위가 됩니다.

1. DGX, HGX, NVL72 구분

AI GPU 인프라 자료를 보면 H100, HGX H100, DGX H100처럼 같은 이름에 앞머리만 다른 제품이 계속 나옵니다. 이름은 GPU 칩 → GPU 8개를 묶은 보드 → 보드를 넣은 서버 → 여러 트레이를 묶은 랙 순서로 커집니다. GPU 자체의 구조와 메모리는 AI 인프라를 위한 GPU 개념 정리에서 다뤘고, 이 글은 제품 구분과 사양을, 이어지는 AI 인프라 전력·냉각·네트워크 정리는 데이터센터에 필요한 조건을 다룹니다.

 

Blackwell Ultra 세대에서 GPU 칩이 HGX 보드와 DGX 서버, GB300 NVL72 랙으로 묶이는 구조

 

구분 단위 특징
GPU 칩(SXM 모듈) H100, B200, B300처럼 GPU 하나
HGX GPU 8개 보드 Dell, HPE, Supermicro 같은 OEM이 CPU·NIC·전원을 붙여 서버로 판매
DGX 서버 1대 NVIDIA가 HGX 보드로 만든 완성품, DGX OS와 소프트웨어·지원 포함
NVL72 랙 1개 GPU 72개와 Grace CPU 36개를 NVLink로 묶은 랙 단위 시스템, 전체 수냉
DGX SuperPOD 클러스터 DGX 여러 대와 네트워크, 스토리지, 관리 소프트웨어를 묶은 참조 설계

 

HGX 서버와 DGX는 같은 GPU 보드를 쓰기 때문에 GPU 성능 차이는 거의 없습니다. DGX는 NVIDIA가 부품 구성, 펌웨어, 소프트웨어를 한 번에 검증하고 지원하는 대신 비싸고, HGX 서버는 CPU, 메모리, 스토리지를 원하는 대로 고를 수 있습니다. 저는 SuperPOD처럼 NVIDIA 참조 설계를 그대로 따를 때는 DGX, 기존 서버 벤더와 운영 체계에 맞춰야 할 때는 HGX 서버가 맞다고 봅니다.

2. GPU 세대별 사양

항목 H100 H200 B200 B300 Rubin
세대 Hopper Hopper Blackwell Blackwell Ultra Vera Rubin
GPU 메모리 80GB
HBM3
141GB
HBM3e
180GB
HBM3e
288GB
HBM3e
288GB
HBM4
메모리 대역폭 3.35TB/s 4.8TB/s 8TB/s 8TB/s 약 22TB/s
NVLink(GPU당) 900GB/s 900GB/s 1.8TB/s 1.8TB/s 3.6TB/s
최소 정밀도 FP8 FP8 FP4 FP4 FP4

 

세대가 바뀔 때 가장 크게 늘어나는 것은 메모리입니다. LLM 추론은 모델 가중치와 KV Cache를 GPU 메모리에 올려야 해서, 같은 모델이라도 GPU 메모리가 크면 더 적은 GPU로 서비스할 수 있습니다. B300 메모리는 NVIDIA 제품 페이지가 8개 합계 2.1TB로, 사용자 가이드가 8 × 288GB = 2.3TB로 적고 있어 실제 쓸 수 있는 용량은 장비에서 nvidia-smi로 확인하는 편이 정확합니다. Rubin은 NVIDIA가 예비 사양(Preliminary)으로 공개한 값이라 바뀔 수 있습니다.

3. 시스템 사양과 전력

항목 DGX H100·H200 DGX B200 DGX B300 GB300 NVL72
GPU H100 또는 H200 × 8 B200 × 8 B300 × 8 B300 × 72
+ Grace × 36
GPU 메모리 합계 640GB
/ 1,128GB
1,440GB 2.1TB 20TB
FP8 성능 32 PFLOPS 72 PFLOPS 72 PFLOPS 720 PFLOPS
최대 전력 10.2kW 약 14.3kW 약 14.5kW 랙당 약 130~140kW
크기 8U 10U 10U 랙 1개
NIC ConnectX-7
400Gb/s × 8
ConnectX-7
400Gb/s × 8
ConnectX-8
800Gb/s × 8
ConnectX-8
800Gb/s × 72
냉각 공랭 공랭 공랭 수냉

 

FP8 성능은 NVIDIA 표기대로 Sparsity를 포함한 값입니다. GB300 NVL72 랙 전력은 NVIDIA가 따로 공개하지 않아 파트너 자료에 나온 범위로 적었습니다. GPU 8개 서버 한 대가 10~14kW를 쓰므로, 보통 서버 랙 하나에 들어갈 전력을 서버 한 대가 쓰는 셈입니다. GB300 NVL72는 이 전력이 랙 하나에 130kW 안팎으로 모이기 때문에 공랭으로는 식힐 수 없고 수냉이 필수입니다. 전력과 냉각을 어떻게 준비하는지는 2편에서 이어서 정리했습니다.

4. 직접 확인해 보기

GPU 서버를 받으면 먼저 GPU 모델과 메모리, 전력 제한, GPU끼리의 연결 방식을 확인합니다.

# GPU 모델, 메모리, 현재 전력과 전력 제한
nvidia-smi --query-gpu=index,name,memory.total,power.draw,power.limit \
  --format=csv

# GPU끼리 연결 방식(NV18 = NVLink 18개로 연결)
nvidia-smi topo -m

# NVLink 링크별 속도
nvidia-smi nvlink -s

HGX·DGX 서버에서 topo 결과의 GPU 사이 칸이 모두 NV18이면 8개 GPU가 NVLink Switch로 서로 연결된 상태입니다. PCIe GPU 서버에서는 PIX, PHB, SYS 같은 값이 보이고, GPU끼리의 통신이 PCIe 스위치나 CPU를 거칩니다.

5. 도입 시 주의점

항목 조치
전력·냉각 서버 한 대가 10~14kW, NVL72는 랙당 100kW를 넘으므로 데이터센터가 수용할 수 있는지부터 확인합니다.
네트워크 GPU마다 400~800Gb/s NIC이 붙으므로 InfiniBand나 Spectrum-X Ethernet Fabric을 함께 설계합니다.
GPU 메모리 서비스할 모델 크기와 KV Cache를 기준으로 필요한 GPU 메모리와 GPU 수를 먼저 계산합니다.
소프트웨어 세대마다 드라이버, CUDA, NCCL 최소 버전이 다르므로 컨테이너 이미지와 드라이버를 GPU 세대에 맞춥니다.

6. 정리

  • HGX는 GPU 8개 보드, DGX는 NVIDIA 완성품 서버, NVL72는 GPU 72개를 묶은 랙 단위 시스템입니다.
  • 세대가 바뀌면 GPU 메모리와 NVLink 대역폭이 크게 늘고, Blackwell부터 FP4를 지원합니다.
  • GPU 8개 서버는 10~14kW, NVL72는 랙당 130kW 안팎을 쓰므로 전력과 냉각을 먼저 확인합니다.

참고

728x90
서울
--:--:--
-전체 글
-카테고리
오늘 방문