Network & Server Factory

개인 공부 기록

DGX SuperPOD 3

[NVIDIA] GPU 랙에서 클러스터까지 구성 정리

랙을 넘어서면 GPU는 네트워크로 연결됩니다. NVIDIA 권장 구성(DGX SuperPOD B300)은 서버 64대(GPU 512개)를 한 묶음(SU)으로 만들고, 모든 서버의 같은 번호 GPU를 같은 스위치에 모으는 Rail-optimized 방식으로 연결합니다. 묶음을 늘리면 스위치와 케이블도 같은 비율로 늘고, 여기에 스토리지, 관리망, 작업 배치 도구가 붙어야 클러스터가 완성됩니다.1. SU와 Rail-optimized 구조1편에서 GPU 8개가 서버가 되고 서버 4대가 랙이 되는 과정까지 봤습니다. 2편은 그다음 단계인 SU(Scalable Unit, 확장 단위)부터입니다. SuperPOD B300의 SU는 DGX B300 64대, 랙으로는 16개이고, GPU 512개가 서버 사이 네트워크(C..

AI/인프라 2026.09.26

[NVIDIA] GPU 노드에서 랙까지 구성 정리

GPU 클러스터는 GPU → 노드(서버) → 랙 → SU → 클러스터 순서로 커집니다. 1편은 GPU에서 랙까지를 다룹니다. 서버 안의 GPU 8개는 NVLink라는 전용 고속 도로로 한 방향 900GB/s로 이어지지만, 서버 밖으로는 GPU마다 붙은 800Gb/s(100GB/s) 네트워크 카드로 나가서 속도가 9배 차이 납니다. 이 차이가 클러스터 설계의 출발점입니다.1. 전체 단계NVIDIA 권장 구성(DGX SuperPOD B300)을 기준으로 GPU 한 개가 수천 개짜리 클러스터가 되는 과정을 두 편에 나눠 정리합니다. 1편은 NVLink로 묶이는 구간(Scale-up, GPU → 노드 → 랙)이고, 2편은 네트워크로 묶이는 구간(Scale-out, SU → 클러스터)입니다. 제품별 사양은 DGX..

AI/인프라 2026.09.26

[NVIDIA] AI 인프라 전력·냉각·네트워크 정리

GPU 8개 서버는 한 대가 10~14kW, GB300 NVL72는 랙 하나가 130kW 안팎의 전력을 씁니다. 그래서 AI 인프라는 GPU를 고르기 전에 전기를 얼마나 끌어올 수 있는지, 열을 어떻게 뺄지, GPU끼리 어떻게 연결할지부터 확인해야 합니다. 바람으로 식히는 DGX B300은 랙당 4대(50kW 이상)가 NVIDIA 권장 구성이고, NVL72부터는 물로 식히는 수냉이 필요합니다.1. 전력GPU 서버가 쓰는 전력은 GPU 전력만 더한 값보다 큽니다. CPU, 네트워크 카드, NVLink Switch, 팬, 그리고 전기를 바꾸는 과정의 손실까지 더해지기 때문에, 전력 계획은 GPU가 아니라 서버 전체의 최대 전력을 기준으로 잡습니다(서버별 사양은 DGX와 HGX 사양 비교에서 다뤘습니다). 구..

AI/인프라 2026.09.26
서울
--:--:--
-전체 글
-카테고리
오늘 방문