Network & Server Factory

개인 공부 기록

nvlink 3

[NVIDIA] NVLink와 NVSwitch 차이 정리

NVLink는 GPU를 잇는 고속 연결(선과 포트)이고, NVSwitch는 NVLink 여러 개를 받아 모든 GPU를 같은 속도로 이어 주는 스위치 칩입니다. 네트워크로 치면 NVLink는 랜선과 포트, NVSwitch는 스위치입니다. GPU 2~4개는 NVLink만으로 직접 이을 수 있지만, 8개 이상을 모두 최대 속도로 묶으려면 NVSwitch가 필요하고, Blackwell부터는 이 스위치를 랙 단위로 키워 GPU 72개를 하나로 묶습니다.1. 한눈에 보기GPU 서버 자료에는 NVLink, NVSwitch, NVLink Switch가 섞여 나와서 같은 것처럼 보이기 쉽습니다. 둘은 역할이 다른 짝입니다. NVLink가 GPU에 달린 고속 포트와 선이라면, NVSwitch는 그 선들을 한곳에 모아 누구..

AI/인프라 2026.09.26

[NVIDIA] GPU 노드에서 랙까지 구성 정리

GPU 클러스터는 GPU → 노드(서버) → 랙 → SU → 클러스터 순서로 커집니다. 1편은 GPU에서 랙까지를 다룹니다. 서버 안의 GPU 8개는 NVLink라는 전용 고속 도로로 한 방향 900GB/s로 이어지지만, 서버 밖으로는 GPU마다 붙은 800Gb/s(100GB/s) 네트워크 카드로 나가서 속도가 9배 차이 납니다. 이 차이가 클러스터 설계의 출발점입니다.1. 전체 단계NVIDIA 권장 구성(DGX SuperPOD B300)을 기준으로 GPU 한 개가 수천 개짜리 클러스터가 되는 과정을 두 편에 나눠 정리합니다. 1편은 NVLink로 묶이는 구간(Scale-up, GPU → 노드 → 랙)이고, 2편은 네트워크로 묶이는 구간(Scale-out, SU → 클러스터)입니다. 제품별 사양은 DGX..

AI/인프라 2026.09.26

[AI] AI 인프라를 위한 GPU 개념 정리

GPU는 한 스레드를 빠르게 처리하는 대신 수천 개의 스레드를 동시에 돌리도록 설계된 프로세서이고, 딥러닝의 핵심인 행렬 곱셈이 이런 구조에 잘 맞아 AI 인프라의 기본 단위가 되었습니다. 인프라 관점에서 GPU를 고를 때는 연산 성능보다 먼저 메모리 용량과 대역폭, GPU 사이의 연결 방식, 전력과 냉각을 봐야 합니다. 모델이 GPU 메모리에 들어가지 않으면 다른 조건은 의미가 없기 때문입니다.1. GPU가 AI에 쓰이는 이유NVIDIA CUDA 프로그래밍 가이드는 CPU와 GPU의 차이를 설계 목표로 설명합니다. CPU는 순서대로 이어지는 연산(스레드)을 최대한 빨리 처리하도록 만들어져 수십 개 정도의 스레드를 병렬로 실행하고, GPU는 단일 스레드 성능을 낮추는 대신 수천 개의 스레드를 동시에 실행..

AI/인프라 2026.09.26
서울
--:--:--
-전체 글
-카테고리
오늘 방문