Network & Server Factory

개인 공부 기록

gpu 5

[NVIDIA] A100 MIG 구성 정리

MIG(Multi-Instance GPU)는 GPU 한 장을 하드웨어 수준에서 최대 7개의 작은 GPU로 나누는 기능입니다. 나뉜 인스턴스마다 SM(연산 코어 묶음), 메모리, L2 캐시, 메모리 대역폭을 따로 갖기 때문에 한 인스턴스의 작업이 다른 인스턴스의 속도나 메모리에 영향을 주지 않습니다. A100 40GB는 1g.5gb부터 7g.40gb까지 정해진 프로필로만 나눌 수 있고, 작은 모델 추론이나 개발용 실험처럼 여러 작업이 GPU 한 장을 서로 방해 없이 나눠 써야 할 때 효과가 큽니다.1. MIG란A100 40GB 한 장을 작은 추론 서비스 하나가 쓰면 GPU 대부분이 놀게 됩니다. 여러 작업을 같이 올리면 이번에는 한 작업이 메모리를 다 차지하거나 연산을 몰아 써서 다른 작업이 느려집니다. ..

AI/인프라 2026.09.27

[Azure] AKS GPU 노드풀 구성 정리

AKS에서 GPU 워크로드를 돌리려면 GPU VM 크기로 별도 노드풀을 만들고, GPU를 쿠버네티스 자원(nvidia.com/gpu)으로 보이게 하는 NVIDIA 드라이버와 디바이스 플러그인을 갖춰야 합니다. AKS는 드라이버만 설치하는 기본 방식, 드라이버부터 디바이스 플러그인과 메트릭 수집까지 맡는 관리형 GPU 노드풀(미리 보기), 모두 직접 설치하는 방식을 제공합니다. VM 크기, 테인트, 설치 방식, MIG 설정은 노드풀을 만들 때 정해져서 나중에 바꿀 수 없으므로 처음에 설계를 끝내야 합니다.1. GPU가 파드까지 전달되는 구조GPU VM으로 노드를 만들었다고 해서 파드가 바로 GPU를 쓸 수 있는 것은 아닙니다. OS가 GPU를 인식하려면 NVIDIA 드라이버가 필요하고, 쿠버네티스 스케줄러..

Cloud/Azure 2026.09.27

[AI] LLM 추론 GPU 메모리 계산 정리

LLM 추론에 필요한 GPU 메모리는 모델 가중치, KV 캐시, 계산 중에 잠깐 쓰는 공간으로 나뉩니다. 가중치는 모델을 올리는 순간 크기가 정해지지만, KV 캐시는 요청에 들어 있는 토큰 수에 비례해서 요청이 길어지고 동시 요청이 많아질수록 계속 커집니다. 그래서 GPU를 고를 때는 모델이 들어가는지만 보지 말고, 가중치를 올리고 남은 메모리에 토큰을 몇 개나 저장할 수 있는지까지 계산해야 합니다.1. 추론 메모리의 구성GPU 개념 정리 글에서는 70B 모델의 가중치 메모리만 계산하고, 실제로는 KV 캐시와 실행 공간이 더 필요하다고 적었습니다. 이번 글에서는 그 나머지를 계산해서, GPU 한 장에 어떤 모델을 몇 개의 요청과 함께 올릴 수 있는지 어림하는 방법을 정리합니다. 구성크기를 정하는 값과 특..

AI/인프라 2026.09.27

[AI] AI 인프라를 위한 GPU 개념 정리

GPU는 한 스레드를 빠르게 처리하는 대신 수천 개의 스레드를 동시에 돌리도록 설계된 프로세서이고, 딥러닝의 핵심인 행렬 곱셈이 이런 구조에 잘 맞아 AI 인프라의 기본 단위가 되었습니다. 인프라 관점에서 GPU를 고를 때는 연산 성능보다 먼저 메모리 용량과 대역폭, GPU 사이의 연결 방식, 전력과 냉각을 봐야 합니다. 모델이 GPU 메모리에 들어가지 않으면 다른 조건은 의미가 없기 때문입니다.1. GPU가 AI에 쓰이는 이유NVIDIA CUDA 프로그래밍 가이드는 CPU와 GPU의 차이를 설계 목표로 설명합니다. CPU는 순서대로 이어지는 연산(스레드)을 최대한 빨리 처리하도록 만들어져 수십 개 정도의 스레드를 병렬로 실행하고, GPU는 단일 스레드 성능을 낮추는 대신 수천 개의 스레드를 동시에 실행..

AI/인프라 2026.09.26

[ESXi] GPU 패스스루 설정

ESXi 호스트에 GT1030과 Radeon HD3470을 장착하고, GT1030을 Windows VM에 패스스루로 할당했습니다. svga.present를 FALSE로 바꾸고 VM 메모리를 전부 예약해야 VM이 켜지고, 드라이버는 RDP로 접속해 설치했습니다.1. 환경항목내용GPUNVIDIA GT1030, AMD Radeon HD3470할당 대상Windows VM (GT1030)필요 조건BIOS에서 VT-d 활성화2. 호스트에서 패스스루 활성화ESXi에 로그인해 탐색기 > 관리 > 하드웨어로 이동합니다. 패스스루할 그래픽카드를 선택하고 패스스루 전환을 누른 뒤 호스트를 재부팅합니다.그래픽카드 패스스루 전환그래픽카드가 목록에 보이지만 회색으로 선택되지 않는다면 BIOS에서 VT-d(Intel VT for ..

서울
--:--:--
-전체 글
-카테고리
오늘 방문