Network & Server Factory

개인 공부 기록

AI 인프라 9

[AI] LLM 양자화 방식 비교 정리

양자화(Quantization)는 모델의 숫자를 더 적은 비트로 줄여 저장하는 기술입니다. 이 글에서는 FP16, INT8, INT4, FP8이 어떻게 다른지, GPTQ와 AWQ 같은 방식이 오차를 어떻게 줄이는지, 그리고 A100 40GB 1장에 7B 모델을 올릴 때 메모리와 속도가 얼마나 달라지는지를 계산으로 정리합니다.1. 양자화란LLM의 가중치(Weight, 학습으로 정해진 숫자)는 보통 FP16이나 BF16으로 저장해서 숫자 하나에 2바이트를 씁니다. 7B 모델이면 가중치만 약 15GB입니다. 양자화는 이 숫자를 8비트나 4비트 같은 더 작은 형식으로 바꿔 저장하는 것입니다. 1mm 눈금 자 대신 5mm 눈금 자로 재는 것과 비슷해서, 적어 둘 칸은 줄지만 눈금 사이 값은 가장 가까운 눈금으로 ..

AI/인프라 2026.09.28

[NVIDIA] A100 MIG 구성 정리

MIG(Multi-Instance GPU)는 GPU 한 장을 하드웨어 수준에서 최대 7개의 작은 GPU로 나누는 기능입니다. 나뉜 인스턴스마다 SM(연산 코어 묶음), 메모리, L2 캐시, 메모리 대역폭을 따로 갖기 때문에 한 인스턴스의 작업이 다른 인스턴스의 속도나 메모리에 영향을 주지 않습니다. A100 40GB는 1g.5gb부터 7g.40gb까지 정해진 프로필로만 나눌 수 있고, 작은 모델 추론이나 개발용 실험처럼 여러 작업이 GPU 한 장을 서로 방해 없이 나눠 써야 할 때 효과가 큽니다.1. MIG란A100 40GB 한 장을 작은 추론 서비스 하나가 쓰면 GPU 대부분이 놀게 됩니다. 여러 작업을 같이 올리면 이번에는 한 작업이 메모리를 다 차지하거나 연산을 몰아 써서 다른 작업이 느려집니다. ..

AI/인프라 2026.09.27

[NVIDIA] NVLink와 NVSwitch 차이 정리

NVLink는 GPU를 잇는 고속 연결(선과 포트)이고, NVSwitch는 NVLink 여러 개를 받아 모든 GPU를 같은 속도로 이어 주는 스위치 칩입니다. 네트워크로 치면 NVLink는 랜선과 포트, NVSwitch는 스위치입니다. GPU 2~4개는 NVLink만으로 직접 이을 수 있지만, 8개 이상을 모두 최대 속도로 묶으려면 NVSwitch가 필요하고, Blackwell부터는 이 스위치를 랙 단위로 키워 GPU 72개를 하나로 묶습니다.1. 한눈에 보기GPU 서버 자료에는 NVLink, NVSwitch, NVLink Switch가 섞여 나와서 같은 것처럼 보이기 쉽습니다. 둘은 역할이 다른 짝입니다. NVLink가 GPU에 달린 고속 포트와 선이라면, NVSwitch는 그 선들을 한곳에 모아 누구..

AI/인프라 2026.09.26

[AI] 학습과 추론의 GPU 병렬화 방식 정리

모델이 커지면 GPU 한 장에 다 올라가지 않아서 여러 GPU가 일을 나눠 맡습니다. 나누는 방법은 크게 데이터를 나누는 방식(DP), 레이어 하나를 쪼개는 방식(TP), 레이어를 순서대로 나눠 맡는 방식(PP)이고, 큰 MoE 모델과 긴 문맥을 위한 방식(EP, CP)이 더해집니다. 같은 방식이라도 학습에서는 "메모리에 다 들어가는가"가, 추론에서는 "답이 얼마나 빨리, 많이 나오는가"가 기준이라 쓰는 이유가 다릅니다.1. 학습과 추론의 메모리학습은 모델 가중치만 올리는 게 아니라, 가중치를 얼마나 고칠지 계산한 값(Gradient)과 고치는 방향을 기억해 두는 값(Optimizer 상태)도 함께 올려야 합니다. 흔히 쓰는 Mixed Precision과 Adam 조합이면 파라미터 하나에 약 16바이트가..

AI/인프라 2026.09.26

[NVIDIA] GPU 랙에서 클러스터까지 구성 정리

랙을 넘어서면 GPU는 네트워크로 연결됩니다. NVIDIA 권장 구성(DGX SuperPOD B300)은 서버 64대(GPU 512개)를 한 묶음(SU)으로 만들고, 모든 서버의 같은 번호 GPU를 같은 스위치에 모으는 Rail-optimized 방식으로 연결합니다. 묶음을 늘리면 스위치와 케이블도 같은 비율로 늘고, 여기에 스토리지, 관리망, 작업 배치 도구가 붙어야 클러스터가 완성됩니다.1. SU와 Rail-optimized 구조1편에서 GPU 8개가 서버가 되고 서버 4대가 랙이 되는 과정까지 봤습니다. 2편은 그다음 단계인 SU(Scalable Unit, 확장 단위)부터입니다. SuperPOD B300의 SU는 DGX B300 64대, 랙으로는 16개이고, GPU 512개가 서버 사이 네트워크(C..

AI/인프라 2026.09.26

[NVIDIA] GPU 노드에서 랙까지 구성 정리

GPU 클러스터는 GPU → 노드(서버) → 랙 → SU → 클러스터 순서로 커집니다. 1편은 GPU에서 랙까지를 다룹니다. 서버 안의 GPU 8개는 NVLink라는 전용 고속 도로로 한 방향 900GB/s로 이어지지만, 서버 밖으로는 GPU마다 붙은 800Gb/s(100GB/s) 네트워크 카드로 나가서 속도가 9배 차이 납니다. 이 차이가 클러스터 설계의 출발점입니다.1. 전체 단계NVIDIA 권장 구성(DGX SuperPOD B300)을 기준으로 GPU 한 개가 수천 개짜리 클러스터가 되는 과정을 두 편에 나눠 정리합니다. 1편은 NVLink로 묶이는 구간(Scale-up, GPU → 노드 → 랙)이고, 2편은 네트워크로 묶이는 구간(Scale-out, SU → 클러스터)입니다. 제품별 사양은 DGX..

AI/인프라 2026.09.26

[NVIDIA] AI 인프라 전력·냉각·네트워크 정리

GPU 8개 서버는 한 대가 10~14kW, GB300 NVL72는 랙 하나가 130kW 안팎의 전력을 씁니다. 그래서 AI 인프라는 GPU를 고르기 전에 전기를 얼마나 끌어올 수 있는지, 열을 어떻게 뺄지, GPU끼리 어떻게 연결할지부터 확인해야 합니다. 바람으로 식히는 DGX B300은 랙당 4대(50kW 이상)가 NVIDIA 권장 구성이고, NVL72부터는 물로 식히는 수냉이 필요합니다.1. 전력GPU 서버가 쓰는 전력은 GPU 전력만 더한 값보다 큽니다. CPU, 네트워크 카드, NVLink Switch, 팬, 그리고 전기를 바꾸는 과정의 손실까지 더해지기 때문에, 전력 계획은 GPU가 아니라 서버 전체의 최대 전력을 기준으로 잡습니다(서버별 사양은 DGX와 HGX 사양 비교에서 다뤘습니다). 구..

AI/인프라 2026.09.26

[NVIDIA] DGX와 HGX 사양 비교

HGX는 GPU 8개를 고속 연결 장치(NVLink Switch)와 함께 보드 하나에 올린 부품이고, DGX는 NVIDIA가 그 보드로 직접 만든 완성품 서버입니다. 같은 세대면 GPU 성능은 같고, 누가 서버를 만들고 지원하느냐가 다릅니다. GB300 NVL72부터는 GPU 72개를 한 덩어리로 묶어서 서버가 아니라 랙 하나가 한 단위가 됩니다.1. DGX, HGX, NVL72 구분AI GPU 자료를 보면 H100, HGX H100, DGX H100처럼 이름은 비슷한데 앞머리만 다른 제품이 계속 나옵니다. 컴퓨터 부품으로 비유하면 GPU는 그래픽 칩, HGX는 칩 8개를 올려 둔 메인보드, DGX는 그 메인보드로 조립한 완성품 PC, NVL72는 여러 대를 한 몸처럼 묶은 랙입니다. GPU 자체의 구조..

AI/인프라 2026.09.26

[AI] AI 인프라를 위한 GPU 개념 정리

GPU는 한 스레드를 빠르게 처리하는 대신 수천 개의 스레드를 동시에 돌리도록 설계된 프로세서이고, 딥러닝의 핵심인 행렬 곱셈이 이런 구조에 잘 맞아 AI 인프라의 기본 단위가 되었습니다. 인프라 관점에서 GPU를 고를 때는 연산 성능보다 먼저 메모리 용량과 대역폭, GPU 사이의 연결 방식, 전력과 냉각을 봐야 합니다. 모델이 GPU 메모리에 들어가지 않으면 다른 조건은 의미가 없기 때문입니다.1. GPU가 AI에 쓰이는 이유NVIDIA CUDA 프로그래밍 가이드는 CPU와 GPU의 차이를 설계 목표로 설명합니다. CPU는 순서대로 이어지는 연산(스레드)을 최대한 빨리 처리하도록 만들어져 수십 개 정도의 스레드를 병렬로 실행하고, GPU는 단일 스레드 성능을 낮추는 대신 수천 개의 스레드를 동시에 실행..

AI/인프라 2026.09.26
서울
--:--:--
-전체 글
-카테고리
오늘 방문