Network & Server Factory

개인 공부 기록

전체 글 528

[Azure] Azure Backup과 Site Recovery 정리

Azure Backup은 데이터를 예전 시점으로 되돌리는 서비스이고, Site Recovery는 리전에 장애가 났을 때 다른 리전에서 서버를 바로 다시 켜는 서비스입니다. Backup은 하루 한 번에서 4시간마다 복구 지점을 만들어 Vault에 오래 보관하고, Site Recovery는 디스크 변경을 계속 복제해 5분마다 복구 지점을 만들고 최대 15일 보관합니다. 목적이 달라서 운영 서버는 보통 둘 다 켭니다.1. 한눈에 보기둘 다 "복구"라는 말이 붙어 헷갈리기 쉽지만 막는 사고가 다릅니다. Backup은 과거 시점을 찍어 두는 사진첩이라 실수로 지운 파일이나 랜섬웨어처럼 "데이터가 망가진" 상황에 씁니다. Site Recovery는 다른 리전에 대기시켜 둔 예비 서버라 리전 장애처럼 "서버가 있는 ..

Cloud/Azure 2026.09.26

[NVIDIA] NVLink와 NVSwitch 차이 정리

NVLink는 GPU를 잇는 고속 연결(선과 포트)이고, NVSwitch는 NVLink 여러 개를 받아 모든 GPU를 같은 속도로 이어 주는 스위치 칩입니다. 네트워크로 치면 NVLink는 랜선과 포트, NVSwitch는 스위치입니다. GPU 2~4개는 NVLink만으로 직접 이을 수 있지만, 8개 이상을 모두 최대 속도로 묶으려면 NVSwitch가 필요하고, Blackwell부터는 이 스위치를 랙 단위로 키워 GPU 72개를 하나로 묶습니다.1. 한눈에 보기GPU 서버 자료에는 NVLink, NVSwitch, NVLink Switch가 섞여 나와서 같은 것처럼 보이기 쉽습니다. 둘은 역할이 다른 짝입니다. NVLink가 GPU에 달린 고속 포트와 선이라면, NVSwitch는 그 선들을 한곳에 모아 누구..

AI/인프라 2026.09.26

[AI] 프롬프트, RAG, 파인튜닝 선택 기준 정리

프롬프트, RAG, 파인튜닝은 서로 대신하는 관계가 아니라 해결하는 문제가 다릅니다. 모델이 필요한 정보를 모르는 지식 문제라면 프롬프트에 직접 넣거나 RAG로 검색해 넣고, 정보는 있는데 답의 형식이나 판단이 일관되지 않은 행동 문제라면 프롬프트를 다듬고 그래도 부족할 때 파인튜닝을 검토합니다. 어느 경우든 평가 세트를 먼저 만들고 프롬프트부터 시작하는 것이 시간과 비용이 가장 적게 듭니다.1. 세 방법이 바꾸는 것세 방법은 모델의 어디를 바꾸느냐가 다릅니다. 프롬프트와 RAG는 매 요청마다 모델에 들어가는 입력을 바꾸고, 파인튜닝은 추가 학습으로 모델의 가중치 자체를 바꿉니다.프롬프트와 RAG는 요청마다 입력을 구성하고, 파인튜닝은 모든 요청에 적용되는 모델을 바꿉니다 방법바꾸는 곳과 특징프롬프트지시..

AI/개념 2026.09.26

[AI] AI 에이전트와 MCP 개념 정리

AI 에이전트는 LLM이 도구를 골라 호출하고, 그 결과를 보고 다음 행동을 다시 정하는 과정을 목표를 이룰 때까지 반복하는 시스템입니다. MCP(Model Context Protocol)는 AI 애플리케이션이 이런 도구와 데이터를 연결하는 방식을 표준화한 개방형 프로토콜로, 도구를 MCP 서버로 한 번 만들어 두면 MCP를 지원하는 여러 애플리케이션에서 쓸 수 있습니다. 모델은 도구 호출을 요청할 뿐이고 실제 실행은 MCP 서버가 자신의 계정과 토큰으로 하기 때문에, 에이전트가 할 수 있는 일의 한계는 서버에 준 권한이 정합니다.1. AI 에이전트란LLM 자체는 텍스트를 입력받아 텍스트를 생성할 뿐, 서버에 접속하거나 명령을 실행하지 못합니다. 여기에 검색, 도구, 메모리를 붙이면 할 수 있는 일이 늘..

AI/개념 2026.09.26

[AI] RAG 개념과 사내 문서 챗봇 구성 정리

RAG는 질문과 관련된 문서를 먼저 검색해 프롬프트에 넣고, 모델이 그 내용을 근거로 답하게 하는 방식입니다. 모델을 다시 학습시키지 않아도 사내 문서처럼 모델이 모르는 정보를 답에 반영할 수 있습니다. 문서를 청크로 나눠 임베딩으로 바꾸고 벡터 DB에 저장하는 색인 단계와, 질문이 들어오면 비슷한 청크를 찾아 모델에 넘기는 질의 단계로 나뉩니다. 모델은 검색된 청크만 볼 수 있으므로, 사내 문서 챗봇의 답 품질과 보안은 수집, 검색, 권한 처리를 맡는 인프라 부품에서 크게 갈립니다.1. RAG가 필요한 이유LLM은 학습 데이터에 있던 내용만 알고, 사내 위키나 런북, 지난주 장애 보고서는 알지 못합니다. 이런 정보를 답에 반영하는 방법은 크게 세 가지입니다. 문서를 매번 프롬프트에 직접 붙이는 방법, ..

AI/개념 2026.09.26

[AI] 학습과 추론의 GPU 병렬화 방식 정리

모델이 커지면 GPU 한 장에 다 올라가지 않아서 여러 GPU가 일을 나눠 맡습니다. 나누는 방법은 크게 데이터를 나누는 방식(DP), 레이어 하나를 쪼개는 방식(TP), 레이어를 순서대로 나눠 맡는 방식(PP)이고, 큰 MoE 모델과 긴 문맥을 위한 방식(EP, CP)이 더해집니다. 같은 방식이라도 학습에서는 "메모리에 다 들어가는가"가, 추론에서는 "답이 얼마나 빨리, 많이 나오는가"가 기준이라 쓰는 이유가 다릅니다.1. 학습과 추론의 메모리학습은 모델 가중치만 올리는 게 아니라, 가중치를 얼마나 고칠지 계산한 값(Gradient)과 고치는 방향을 기억해 두는 값(Optimizer 상태)도 함께 올려야 합니다. 흔히 쓰는 Mixed Precision과 Adam 조합이면 파라미터 하나에 약 16바이트가..

AI/인프라 2026.09.26

[AI] LLM 토큰과 컨텍스트 윈도우 개념 정리

LLM은 글자가 아니라 토큰 단위로 입력을 읽고 출력을 만들며, 요금과 한도도 모두 토큰으로 계산합니다. 긴 입력은 첫 응답을 늦추고, 긴 출력은 전체 응답 시간을 늘립니다. 컨텍스트 윈도우는 모델이 한 번에 볼 수 있는 토큰 한도인데, 한도 안에 들어가더라도 입력이 길수록 정보를 찾아내는 정확도가 떨어지고 중간에 있는 내용을 놓치기 쉽습니다. 그래서 긴 로그는 통째로 넣기보다 필요한 구간을 잘라 집계한 뒤 넣는 편이 비용과 정확도 모두에 유리합니다.1. 토큰이란토큰은 모델이 텍스트를 처리하는 단위입니다. OpenAI 도움말은 토큰이 글자 하나일 수도, 단어의 일부나 단어 전체, 문장 부호일 수도 있고, 같은 텍스트라도 모델과 언어에 따라 토큰 수가 달라진다고 설명합니다. 모델에 텍스트를 보내면 토크나이..

AI/개념 2026.09.26

[NVIDIA] GPU 랙에서 클러스터까지 구성 정리

랙을 넘어서면 GPU는 네트워크로 연결됩니다. NVIDIA 권장 구성(DGX SuperPOD B300)은 서버 64대(GPU 512개)를 한 묶음(SU)으로 만들고, 모든 서버의 같은 번호 GPU를 같은 스위치에 모으는 Rail-optimized 방식으로 연결합니다. 묶음을 늘리면 스위치와 케이블도 같은 비율로 늘고, 여기에 스토리지, 관리망, 작업 배치 도구가 붙어야 클러스터가 완성됩니다.1. SU와 Rail-optimized 구조1편에서 GPU 8개가 서버가 되고 서버 4대가 랙이 되는 과정까지 봤습니다. 2편은 그다음 단계인 SU(Scalable Unit, 확장 단위)부터입니다. SuperPOD B300의 SU는 DGX B300 64대, 랙으로는 16개이고, GPU 512개가 서버 사이 네트워크(C..

AI/인프라 2026.09.26

[NVIDIA] GPU 노드에서 랙까지 구성 정리

GPU 클러스터는 GPU → 노드(서버) → 랙 → SU → 클러스터 순서로 커집니다. 1편은 GPU에서 랙까지를 다룹니다. 서버 안의 GPU 8개는 NVLink라는 전용 고속 도로로 한 방향 900GB/s로 이어지지만, 서버 밖으로는 GPU마다 붙은 800Gb/s(100GB/s) 네트워크 카드로 나가서 속도가 9배 차이 납니다. 이 차이가 클러스터 설계의 출발점입니다.1. 전체 단계NVIDIA 권장 구성(DGX SuperPOD B300)을 기준으로 GPU 한 개가 수천 개짜리 클러스터가 되는 과정을 두 편에 나눠 정리합니다. 1편은 NVLink로 묶이는 구간(Scale-up, GPU → 노드 → 랙)이고, 2편은 네트워크로 묶이는 구간(Scale-out, SU → 클러스터)입니다. 제품별 사양은 DGX..

AI/인프라 2026.09.26

[NVIDIA] AI 인프라 전력·냉각·네트워크 정리

GPU 8개 서버는 한 대가 10~14kW, GB300 NVL72는 랙 하나가 130kW 안팎의 전력을 씁니다. 그래서 AI 인프라는 GPU를 고르기 전에 전기를 얼마나 끌어올 수 있는지, 열을 어떻게 뺄지, GPU끼리 어떻게 연결할지부터 확인해야 합니다. 바람으로 식히는 DGX B300은 랙당 4대(50kW 이상)가 NVIDIA 권장 구성이고, NVL72부터는 물로 식히는 수냉이 필요합니다.1. 전력GPU 서버가 쓰는 전력은 GPU 전력만 더한 값보다 큽니다. CPU, 네트워크 카드, NVLink Switch, 팬, 그리고 전기를 바꾸는 과정의 손실까지 더해지기 때문에, 전력 계획은 GPU가 아니라 서버 전체의 최대 전력을 기준으로 잡습니다(서버별 사양은 DGX와 HGX 사양 비교에서 다뤘습니다). 구..

AI/인프라 2026.09.26
서울
--:--:--
-전체 글
-카테고리
오늘 방문