Network & Server Factory

개인 공부 기록

nvidia 2

[NVIDIA] A100 MIG 구성 정리

MIG(Multi-Instance GPU)는 GPU 한 장을 하드웨어 수준에서 최대 7개의 작은 GPU로 나누는 기능입니다. 나뉜 인스턴스마다 SM(연산 코어 묶음), 메모리, L2 캐시, 메모리 대역폭을 따로 갖기 때문에 한 인스턴스의 작업이 다른 인스턴스의 속도나 메모리에 영향을 주지 않습니다. A100 40GB는 1g.5gb부터 7g.40gb까지 정해진 프로필로만 나눌 수 있고, 작은 모델 추론이나 개발용 실험처럼 여러 작업이 GPU 한 장을 서로 방해 없이 나눠 써야 할 때 효과가 큽니다.1. MIG란A100 40GB 한 장을 작은 추론 서비스 하나가 쓰면 GPU 대부분이 놀게 됩니다. 여러 작업을 같이 올리면 이번에는 한 작업이 메모리를 다 차지하거나 연산을 몰아 써서 다른 작업이 느려집니다. ..

AI/인프라 2026.09.27

[Azure] AKS GPU 노드풀 구성 정리

AKS에서 GPU 워크로드를 돌리려면 GPU VM 크기로 별도 노드풀을 만들고, GPU를 쿠버네티스 자원(nvidia.com/gpu)으로 보이게 하는 NVIDIA 드라이버와 디바이스 플러그인을 갖춰야 합니다. AKS는 드라이버만 설치하는 기본 방식, 드라이버부터 디바이스 플러그인과 메트릭 수집까지 맡는 관리형 GPU 노드풀(미리 보기), 모두 직접 설치하는 방식을 제공합니다. VM 크기, 테인트, 설치 방식, MIG 설정은 노드풀을 만들 때 정해져서 나중에 바꿀 수 없으므로 처음에 설계를 끝내야 합니다.1. GPU가 파드까지 전달되는 구조GPU VM으로 노드를 만들었다고 해서 파드가 바로 GPU를 쓸 수 있는 것은 아닙니다. OS가 GPU를 인식하려면 NVIDIA 드라이버가 필요하고, 쿠버네티스 스케줄러..

Cloud/Azure 2026.09.27
서울
--:--:--
-전체 글
-카테고리
오늘 방문