Network & Server Factory

개인 공부 기록

AI/인프라 3

[NVIDIA] AI 인프라 전력·냉각·네트워크 정리

GPU 8개 서버는 한 대가 10~14kW, GB300 NVL72는 랙 하나가 130kW 안팎을 씁니다. 그래서 AI 인프라는 GPU를 고르기 전에 전력, 냉각, 네트워크부터 확인해야 합니다. 공랭 DGX B300은 랙당 4대(50kW 이상)가 NVIDIA 참조 구성이고, NVL72부터는 수냉과 CDU가 필요합니다. GPU 사이 통신은 NVLink와 GPU마다 붙는 800Gb/s NIC으로 만든 Compute Fabric이 맡습니다.1. 전력GPU 서버 전력은 GPU 소비 전력의 합보다 큽니다. CPU, NIC, NVLink Switch, 팬, 전원 변환 손실이 더해지기 때문에 전력 계획은 GPU가 아니라 시스템 최대 전력을 기준으로 잡습니다(서버별 사양은 DGX와 HGX 사양 비교에서 다뤘습니다). 구..

AI/인프라 01:11:42

[NVIDIA] DGX와 HGX 사양 비교

HGX는 GPU 8개와 NVLink Switch를 보드 하나에 올린 플랫폼이고, DGX는 NVIDIA가 이 보드로 직접 만든 완성품 서버입니다. 같은 세대라면 GPU 성능은 같고, 차이는 누가 서버를 만들고 지원하느냐입니다. GPU 72개를 하나의 NVLink 도메인으로 묶는 GB300 NVL72부터는 서버가 아니라 랙이 한 단위가 됩니다.1. DGX, HGX, NVL72 구분AI GPU 인프라 자료를 보면 H100, HGX H100, DGX H100처럼 같은 이름에 앞머리만 다른 제품이 계속 나옵니다. 이름은 GPU 칩 → GPU 8개를 묶은 보드 → 보드를 넣은 서버 → 여러 트레이를 묶은 랙 순서로 커집니다. GPU 자체의 구조와 메모리는 AI 인프라를 위한 GPU 개념 정리에서 다뤘고, 이 글은 ..

AI/인프라 01:09:43

[AI] AI 인프라를 위한 GPU 개념 정리

GPU는 한 스레드를 빠르게 처리하는 대신 수천 개의 스레드를 동시에 돌리도록 설계된 프로세서이고, 딥러닝의 핵심인 행렬 곱셈이 이런 구조에 잘 맞아 AI 인프라의 기본 단위가 되었습니다. 인프라 관점에서 GPU를 고를 때는 연산 성능보다 먼저 메모리 용량과 대역폭, GPU 사이의 연결 방식, 전력과 냉각을 봐야 합니다. 모델이 GPU 메모리에 들어가지 않으면 다른 조건은 의미가 없기 때문입니다.1. GPU가 AI에 쓰이는 이유NVIDIA CUDA 프로그래밍 가이드는 CPU와 GPU의 차이를 설계 목표로 설명합니다. CPU는 순서대로 이어지는 연산(스레드)을 최대한 빨리 처리하도록 만들어져 수십 개 정도의 스레드를 병렬로 실행하고, GPU는 단일 스레드 성능을 낮추는 대신 수천 개의 스레드를 동시에 실행..

AI/인프라 01:08:54
서울
--:--:--
-전체 글
-카테고리
오늘 방문