Network & Server Factory

개인 공부 기록

전체 글 519

[NVIDIA] AI 인프라 전력·냉각·네트워크 정리

GPU 8개 서버는 한 대가 10~14kW, GB300 NVL72는 랙 하나가 130kW 안팎을 씁니다. 그래서 AI 인프라는 GPU를 고르기 전에 전력, 냉각, 네트워크부터 확인해야 합니다. 공랭 DGX B300은 랙당 4대(50kW 이상)가 NVIDIA 참조 구성이고, NVL72부터는 수냉과 CDU가 필요합니다. GPU 사이 통신은 NVLink와 GPU마다 붙는 800Gb/s NIC으로 만든 Compute Fabric이 맡습니다.1. 전력GPU 서버 전력은 GPU 소비 전력의 합보다 큽니다. CPU, NIC, NVLink Switch, 팬, 전원 변환 손실이 더해지기 때문에 전력 계획은 GPU가 아니라 시스템 최대 전력을 기준으로 잡습니다(서버별 사양은 DGX와 HGX 사양 비교에서 다뤘습니다). 구..

AI/인프라 01:11:42

[NVIDIA] DGX와 HGX 사양 비교

HGX는 GPU 8개와 NVLink Switch를 보드 하나에 올린 플랫폼이고, DGX는 NVIDIA가 이 보드로 직접 만든 완성품 서버입니다. 같은 세대라면 GPU 성능은 같고, 차이는 누가 서버를 만들고 지원하느냐입니다. GPU 72개를 하나의 NVLink 도메인으로 묶는 GB300 NVL72부터는 서버가 아니라 랙이 한 단위가 됩니다.1. DGX, HGX, NVL72 구분AI GPU 인프라 자료를 보면 H100, HGX H100, DGX H100처럼 같은 이름에 앞머리만 다른 제품이 계속 나옵니다. 이름은 GPU 칩 → GPU 8개를 묶은 보드 → 보드를 넣은 서버 → 여러 트레이를 묶은 랙 순서로 커집니다. GPU 자체의 구조와 메모리는 AI 인프라를 위한 GPU 개념 정리에서 다뤘고, 이 글은 ..

AI/인프라 01:09:43

[AI] AI 인프라를 위한 GPU 개념 정리

GPU는 한 스레드를 빠르게 처리하는 대신 수천 개의 스레드를 동시에 돌리도록 설계된 프로세서이고, 딥러닝의 핵심인 행렬 곱셈이 이런 구조에 잘 맞아 AI 인프라의 기본 단위가 되었습니다. 인프라 관점에서 GPU를 고를 때는 연산 성능보다 먼저 메모리 용량과 대역폭, GPU 사이의 연결 방식, 전력과 냉각을 봐야 합니다. 모델이 GPU 메모리에 들어가지 않으면 다른 조건은 의미가 없기 때문입니다.1. GPU가 AI에 쓰이는 이유NVIDIA CUDA 프로그래밍 가이드는 CPU와 GPU의 차이를 설계 목표로 설명합니다. CPU는 순서대로 이어지는 연산(스레드)을 최대한 빨리 처리하도록 만들어져 수십 개 정도의 스레드를 병렬로 실행하고, GPU는 단일 스레드 성능을 낮추는 대신 수천 개의 스레드를 동시에 실행..

AI/인프라 01:08:54

[AI] 생성형 AI 업무 활용 시 보안 주의점 정리

생성형 AI를 업무에 쓸 때 보안 문제는 넣은 데이터가 어디에 남는지, 받은 답을 검증 없이 쓰는지, AI에게 준 권한이 외부 입력과 섞이는지 세 곳에서 생깁니다. 개인 플랜은 학습 설정을 확인하되 학습을 꺼도 대화가 일정 기간 저장된다는 점을 알고 써야 하며, 회사 데이터는 학습에서 제외되는 업무용 플랜에서만 다룹니다. 받은 코드와 명령은 검토한 뒤 실행하고, 에이전트에는 필요한 최소 권한만 줍니다.1. 입력한 데이터가 가는 곳채팅 창에 붙여 넣은 내용은 답을 만드는 데만 쓰이고 사라지지 않습니다. 서비스는 대화를 기록으로 저장하고, 플랜과 설정에 따라 모델 학습이나 사람의 품질 검토에 쓰기도 하며, 학습에서 제외해도 악용 방지를 위해 일정 기간 보관합니다.프롬프트는 답변 생성 외에 저장, 안전 목적 ..

AI/활용 00:27:49

[Azure] Azure Storage 중복성 비교

Azure Storage의 중복성은 Primary Region 안에서 데이터를 어떻게 복제하는지(LRS, ZRS)와 Secondary Region에도 복제하는지(GRS, GZRS)의 조합입니다. 운영 데이터는 ZRS를 기본으로 두고, Region 전체 장애까지 대비해야 하면 GZRS를 고릅니다. 앞에 RA가 붙으면 평소에도 Secondary Region에서 데이터를 읽을 수 있습니다.1. 중복성 옵션Azure Storage는 어떤 옵션을 골라도 Primary Region 안에 데이터를 3개 복사해 둡니다. 차이는 그 3개를 한 데이터센터에 두는지, 여러 Availability Zone에 나눠 두는지, 그리고 멀리 떨어진 Secondary Region에 한 벌 더 두는지입니다(Storage Account ..

Cloud/Azure 00:11:38

[Azure] Azure Storage 종류 정리

Azure Storage는 Storage Account 하나 안에 Blob, Files, Queue, Table 네 가지 서비스를 담는 구조입니다. 새로 만든다면 대부분 Standard general-purpose v2 계정 하나로 충분하고, 파일 공유나 짧은 지연 시간이 필요할 때만 Premium 계정을 고릅니다. Blob은 Access Tier로 자주 쓰는 데이터와 오래 보관할 데이터의 비용을 나눌 수 있습니다.1. Storage Account 구조Storage Account 하나에 Blob, Files, Queue, Table이 들어가고, 서비스마다 주소가 따로 생기는 구조 Storage Account는 데이터를 담는 이름 공간이자 설정 단위입니다. 중복성(Azure Storage 중복성 비교), ..

Cloud/Azure 00:09:09

[AI] 생성형 AI로 에러 로그 분석하는 프롬프트 정리

에러 로그만 붙여 넣고 "원인이 뭐야?"라고 물으면 생성형 AI는 누구에게나 맞는 일반론을 답합니다. 환경, 증상이 시작된 시각과 직전 변경, 이미 확인한 것, 원하는 답의 형식을 함께 주면 원인 후보가 좁혀지고 바로 실행할 확인 명령까지 받을 수 있습니다. 로그는 필요한 구간만 잘라 민감 정보를 가린 뒤 넣고, 받은 답은 읽기 전용 명령으로 검증한 다음에 조치합니다.1. 로그만 붙여 넣으면 생기는 일같은 "502 Bad Gateway"라도 원인은 백엔드 프로세스가 죽었는지, 포트가 바뀌었는지, 방화벽이 막았는지, 타임아웃인지에 따라 전혀 다릅니다. 로그 한 줄에는 이 구분에 필요한 정보가 대부분 빠져 있어서, 모델은 가능한 원인을 모두 나열하는 답을 할 수밖에 없습니다. 구분로그만 넣었을 때맥락을 함께..

AI/활용 00:08:20

[AI] ChatGPT, Gemini, Claude 비교

ChatGPT, Gemini, Claude는 모두 무료로 시작할 수 있고, 개인 기본 유료 플랜은 월 3만 원 안팎입니다. 세 서비스 모두 최신 모델과 코딩 도구, 팀 플랜을 갖추고 있어서 실제 차이는 이미 쓰는 업무 도구와의 연결, 요금제 구성, 데이터 정책에서 더 크게 납니다. 업무에 쓴다면 모델 순위보다 이 세 가지를 먼저 보고 고르는 편이 실용적입니다.1. 한눈에 보기세 서비스의 플랜을 비슷한 단계끼리 나란히 놓은 구성 구분ChatGPTGeminiClaude만든 곳OpenAIGoogleAnthropic개인 기본 유료Plus₩29,000/월Google AI Pro₩29,000/월Pro$22/월(연간 $18/월)업무 도구 연결Excel, Word, PowerPoint,Google Sheets 확장Gm..

AI/활용 2026.09.25

[Azure] Private Link Service 정리

Private Link Service는 내가 만든 서비스를 Standard Load Balancer 뒤에 두고, 다른 VNet이나 다른 회사의 Subscription에서 Private Endpoint로 접속하게 해 주는 기능입니다. 트래픽이 NAT IP로 변환되어 들어오므로 두 VNet의 주소 대역이 겹쳐도 되고, VNet Peering 없이 서비스 하나만 골라서 공개할 수 있습니다. Azure PaaS에 붙이는 Private Endpoint의 반대편, 즉 Provider 쪽 구성입니다.1. Private Link Service란Storage나 SQL Database에 Private Endpoint를 붙이면 Azure가 운영하는 서비스를 내 VNet의 사설 IP로 쓸 수 있습니다(Private Endpo..

Cloud/Azure 2026.09.25

[AI] 머신러닝, 딥러닝, 생성형 AI 개념 정리

AI는 사람이 하던 복잡한 판단을 프로그램이나 모델이 대신하게 만드는 기술 전체를 말하고, 그중 규칙을 사람이 짜는 대신 데이터로 학습시키는 방법이 머신러닝입니다. 딥러닝은 층이 여러 개인 신경망을 쓰는 머신러닝이고, 요즘 말하는 생성형 AI와 LLM은 대부분 딥러닝 모델입니다. 인프라 입장에서는 학습과 추론을 나눠서 보는 것이 자원 설계의 출발점입니다.1. AI란AI(인공지능, Artificial Intelligence)는 번역이나 영상 판독처럼 사람의 판단이 필요했던 복잡한 작업을 처리하는 프로그램이나 모델을 넓게 가리키는 말입니다. 그래서 사람이 조건문을 직접 짠 규칙 기반 프로그램도 넓은 의미의 AI에 들어가고, 판단 기준을 데이터에서 배우는 머신러닝은 그 안의 한 방법입니다. 구분규칙 기반 프로..

AI/개념 2026.09.25
서울
--:--:--
-전체 글
-카테고리
오늘 방문