LLM 추론에 필요한 GPU 메모리는 모델 가중치, KV 캐시, 계산 중에 잠깐 쓰는 공간으로 나뉩니다. 가중치는 모델을 올리는 순간 크기가 정해지지만, KV 캐시는 요청에 들어 있는 토큰 수에 비례해서 요청이 길어지고 동시 요청이 많아질수록 계속 커집니다. 그래서 GPU를 고를 때는 모델이 들어가는지만 보지 말고, 가중치를 올리고 남은 메모리에 토큰을 몇 개나 저장할 수 있는지까지 계산해야 합니다.1. 추론 메모리의 구성GPU 개념 정리 글에서는 70B 모델의 가중치 메모리만 계산하고, 실제로는 KV 캐시와 실행 공간이 더 필요하다고 적었습니다. 이번 글에서는 그 나머지를 계산해서, GPU 한 장에 어떤 모델을 몇 개의 요청과 함께 올릴 수 있는지 어림하는 방법을 정리합니다. 구성크기를 정하는 값과 특..