Network & Server Factory

개인 공부 기록

gpu 클러스터 2

[NVIDIA] GPU 랙에서 클러스터까지 구성 정리

랙을 넘어서면 GPU는 네트워크로 연결됩니다. NVIDIA 권장 구성(DGX SuperPOD B300)은 서버 64대(GPU 512개)를 한 묶음(SU)으로 만들고, 모든 서버의 같은 번호 GPU를 같은 스위치에 모으는 Rail-optimized 방식으로 연결합니다. 묶음을 늘리면 스위치와 케이블도 같은 비율로 늘고, 여기에 스토리지, 관리망, 작업 배치 도구가 붙어야 클러스터가 완성됩니다.1. SU와 Rail-optimized 구조1편에서 GPU 8개가 서버가 되고 서버 4대가 랙이 되는 과정까지 봤습니다. 2편은 그다음 단계인 SU(Scalable Unit, 확장 단위)부터입니다. SuperPOD B300의 SU는 DGX B300 64대, 랙으로는 16개이고, GPU 512개가 서버 사이 네트워크(C..

AI/인프라 2026.09.26

[NVIDIA] GPU 노드에서 랙까지 구성 정리

GPU 클러스터는 GPU → 노드(서버) → 랙 → SU → 클러스터 순서로 커집니다. 1편은 GPU에서 랙까지를 다룹니다. 서버 안의 GPU 8개는 NVLink라는 전용 고속 도로로 한 방향 900GB/s로 이어지지만, 서버 밖으로는 GPU마다 붙은 800Gb/s(100GB/s) 네트워크 카드로 나가서 속도가 9배 차이 납니다. 이 차이가 클러스터 설계의 출발점입니다.1. 전체 단계NVIDIA 권장 구성(DGX SuperPOD B300)을 기준으로 GPU 한 개가 수천 개짜리 클러스터가 되는 과정을 두 편에 나눠 정리합니다. 1편은 NVLink로 묶이는 구간(Scale-up, GPU → 노드 → 랙)이고, 2편은 네트워크로 묶이는 구간(Scale-out, SU → 클러스터)입니다. 제품별 사양은 DGX..

AI/인프라 2026.09.26
서울
--:--:--
-전체 글
-카테고리
오늘 방문