Network & Server Factory

개인 공부 기록

LLM 8

[AI] LLM 양자화 방식 비교 정리

양자화(Quantization)는 모델의 숫자를 더 적은 비트로 줄여 저장하는 기술입니다. 이 글에서는 FP16, INT8, INT4, FP8이 어떻게 다른지, GPTQ와 AWQ 같은 방식이 오차를 어떻게 줄이는지, 그리고 A100 40GB 1장에 7B 모델을 올릴 때 메모리와 속도가 얼마나 달라지는지를 계산으로 정리합니다.1. 양자화란LLM의 가중치(Weight, 학습으로 정해진 숫자)는 보통 FP16이나 BF16으로 저장해서 숫자 하나에 2바이트를 씁니다. 7B 모델이면 가중치만 약 15GB입니다. 양자화는 이 숫자를 8비트나 4비트 같은 더 작은 형식으로 바꿔 저장하는 것입니다. 1mm 눈금 자 대신 5mm 눈금 자로 재는 것과 비슷해서, 적어 둘 칸은 줄지만 눈금 사이 값은 가장 가까운 눈금으로 ..

AI/인프라 2026.09.28

[AI] LLM 추론 GPU 메모리 계산 정리

LLM 추론에 필요한 GPU 메모리는 모델 가중치, KV 캐시, 계산 중에 잠깐 쓰는 공간으로 나뉩니다. 가중치는 모델을 올리는 순간 크기가 정해지지만, KV 캐시는 요청에 들어 있는 토큰 수에 비례해서 요청이 길어지고 동시 요청이 많아질수록 계속 커집니다. 그래서 GPU를 고를 때는 모델이 들어가는지만 보지 말고, 가중치를 올리고 남은 메모리에 토큰을 몇 개나 저장할 수 있는지까지 계산해야 합니다.1. 추론 메모리의 구성GPU 개념 정리 글에서는 70B 모델의 가중치 메모리만 계산하고, 실제로는 KV 캐시와 실행 공간이 더 필요하다고 적었습니다. 이번 글에서는 그 나머지를 계산해서, GPU 한 장에 어떤 모델을 몇 개의 요청과 함께 올릴 수 있는지 어림하는 방법을 정리합니다. 구성크기를 정하는 값과 특..

AI/인프라 2026.09.27

[AI] AI 에이전트와 MCP 개념 정리

AI 에이전트는 LLM이 도구를 골라 호출하고, 그 결과를 보고 다음 행동을 다시 정하는 과정을 목표를 이룰 때까지 반복하는 시스템입니다. MCP(Model Context Protocol)는 AI 애플리케이션이 이런 도구와 데이터를 연결하는 방식을 표준화한 개방형 프로토콜로, 도구를 MCP 서버로 한 번 만들어 두면 MCP를 지원하는 여러 애플리케이션에서 쓸 수 있습니다. 모델은 도구 호출을 요청할 뿐이고 실제 실행은 MCP 서버가 자신의 계정과 토큰으로 하기 때문에, 에이전트가 할 수 있는 일의 한계는 서버에 준 권한이 정합니다.1. AI 에이전트란LLM 자체는 텍스트를 입력받아 텍스트를 생성할 뿐, 서버에 접속하거나 명령을 실행하지 못합니다. 여기에 검색, 도구, 메모리를 붙이면 할 수 있는 일이 늘..

AI/개념 2026.09.26

[AI] RAG 개념과 사내 문서 챗봇 구성 정리

RAG는 질문과 관련된 문서를 먼저 검색해 프롬프트에 넣고, 모델이 그 내용을 근거로 답하게 하는 방식입니다. 모델을 다시 학습시키지 않아도 사내 문서처럼 모델이 모르는 정보를 답에 반영할 수 있습니다. 문서를 청크로 나눠 임베딩으로 바꾸고 벡터 DB에 저장하는 색인 단계와, 질문이 들어오면 비슷한 청크를 찾아 모델에 넘기는 질의 단계로 나뉩니다. 모델은 검색된 청크만 볼 수 있으므로, 사내 문서 챗봇의 답 품질과 보안은 수집, 검색, 권한 처리를 맡는 인프라 부품에서 크게 갈립니다.1. RAG가 필요한 이유LLM은 학습 데이터에 있던 내용만 알고, 사내 위키나 런북, 지난주 장애 보고서는 알지 못합니다. 이런 정보를 답에 반영하는 방법은 크게 세 가지입니다. 문서를 매번 프롬프트에 직접 붙이는 방법, ..

AI/개념 2026.09.26

[AI] 학습과 추론의 GPU 병렬화 방식 정리

모델이 커지면 GPU 한 장에 다 올라가지 않아서 여러 GPU가 일을 나눠 맡습니다. 나누는 방법은 크게 데이터를 나누는 방식(DP), 레이어 하나를 쪼개는 방식(TP), 레이어를 순서대로 나눠 맡는 방식(PP)이고, 큰 MoE 모델과 긴 문맥을 위한 방식(EP, CP)이 더해집니다. 같은 방식이라도 학습에서는 "메모리에 다 들어가는가"가, 추론에서는 "답이 얼마나 빨리, 많이 나오는가"가 기준이라 쓰는 이유가 다릅니다.1. 학습과 추론의 메모리학습은 모델 가중치만 올리는 게 아니라, 가중치를 얼마나 고칠지 계산한 값(Gradient)과 고치는 방향을 기억해 두는 값(Optimizer 상태)도 함께 올려야 합니다. 흔히 쓰는 Mixed Precision과 Adam 조합이면 파라미터 하나에 약 16바이트가..

AI/인프라 2026.09.26

[AI] LLM 토큰과 컨텍스트 윈도우 개념 정리

LLM은 글자가 아니라 토큰 단위로 입력을 읽고 출력을 만들며, 요금과 한도도 모두 토큰으로 계산합니다. 긴 입력은 첫 응답을 늦추고, 긴 출력은 전체 응답 시간을 늘립니다. 컨텍스트 윈도우는 모델이 한 번에 볼 수 있는 토큰 한도인데, 한도 안에 들어가더라도 입력이 길수록 정보를 찾아내는 정확도가 떨어지고 중간에 있는 내용을 놓치기 쉽습니다. 그래서 긴 로그는 통째로 넣기보다 필요한 구간을 잘라 집계한 뒤 넣는 편이 비용과 정확도 모두에 유리합니다.1. 토큰이란토큰은 모델이 텍스트를 처리하는 단위입니다. OpenAI 도움말은 토큰이 글자 하나일 수도, 단어의 일부나 단어 전체, 문장 부호일 수도 있고, 같은 텍스트라도 모델과 언어에 따라 토큰 수가 달라진다고 설명합니다. 모델에 텍스트를 보내면 토크나이..

AI/개념 2026.09.26

[AI] ChatGPT, Gemini, Claude 비교

ChatGPT, Gemini, Claude는 모두 무료로 시작할 수 있고, 개인 기본 유료 플랜은 월 3만 원 안팎입니다. 세 서비스 모두 최신 모델과 코딩 도구, 팀 플랜을 갖추고 있어서 실제 차이는 이미 쓰는 업무 도구와의 연결, 요금제 구성, 데이터 정책에서 더 크게 납니다. 업무에 쓴다면 모델 순위보다 이 세 가지를 먼저 보고 고르는 편이 실용적입니다.1. 한눈에 보기세 서비스의 플랜을 비슷한 단계끼리 나란히 놓은 구성 구분ChatGPTGeminiClaude만든 곳OpenAIGoogleAnthropic개인 기본 유료Plus₩29,000/월Google AI Pro₩29,000/월Pro$22/월(연간 $18/월)업무 도구 연결Excel, Word, PowerPoint,Google Sheets 확장Gm..

AI/활용 2026.09.25

[AI] 머신러닝, 딥러닝, 생성형 AI 개념 정리

AI는 사람이 하던 복잡한 판단을 프로그램이나 모델이 대신하게 만드는 기술 전체를 말하고, 그중 규칙을 사람이 짜는 대신 데이터로 학습시키는 방법이 머신러닝입니다. 딥러닝은 층이 여러 개인 신경망을 쓰는 머신러닝이고, 요즘 말하는 생성형 AI와 LLM은 대부분 딥러닝 모델입니다. 인프라 입장에서는 학습과 추론을 나눠서 보는 것이 자원 설계의 출발점입니다.1. AI란AI(인공지능, Artificial Intelligence)는 번역이나 영상 판독처럼 사람의 판단이 필요했던 복잡한 작업을 처리하는 프로그램이나 모델을 넓게 가리키는 말입니다. 그래서 사람이 조건문을 직접 짠 규칙 기반 프로그램도 넓은 의미의 AI에 들어가고, 판단 기준을 데이터에서 배우는 머신러닝은 그 안의 한 방법입니다. 구분규칙 기반 프로..

AI/개념 2026.09.25
서울
--:--:--
-전체 글
-카테고리
오늘 방문