LLM은 글자가 아니라 토큰 단위로 입력을 읽고 출력을 만들며, 요금과 한도도 모두 토큰으로 계산합니다. 긴 입력은 첫 응답을 늦추고, 긴 출력은 전체 응답 시간을 늘립니다. 컨텍스트 윈도우는 모델이 한 번에 볼 수 있는 토큰 한도인데, 한도 안에 들어가더라도 입력이 길수록 정보를 찾아내는 정확도가 떨어지고 중간에 있는 내용을 놓치기 쉽습니다. 그래서 긴 로그는 통째로 넣기보다 필요한 구간을 잘라 집계한 뒤 넣는 편이 비용과 정확도 모두에 유리합니다.1. 토큰이란토큰은 모델이 텍스트를 처리하는 단위입니다. OpenAI 도움말은 토큰이 글자 하나일 수도, 단어의 일부나 단어 전체, 문장 부호일 수도 있고, 같은 텍스트라도 모델과 언어에 따라 토큰 수가 달라진다고 설명합니다. 모델에 텍스트를 보내면 토크나이..