학습 이후에도 답을 만드는 계산은 남는다

학습은 모델의 매개변수를 만드는 과정이고, 추론은 그 모델을 사용해 입력에 대한 결과를 계산하는 과정입니다. 서비스 이용자는 모델 학습비를 직접 내지 않더라도 요청을 처리하는 API나 서버 비용을 낼 수 있습니다. 소비자용 월 구독료와 개발자용 API 요금도 같은 항목이라고 가정하면 안 됩니다.

입력과 출력 단가를 분리해서 계산

가상의 API가 입력 100만 토큰당 1달러, 출력 100만 토큰당 4달러라고 가정하겠습니다. 호출당 입력 2,000·출력 500토큰을 1,000회 쓰면 입력은 200만 토큰으로 2달러, 출력은 50만 토큰으로 2달러입니다. 합계는 4달러입니다. 세금·환율·검색 도구·캐시 등은 제외했습니다. 이 단가는 실제 요금표가 아닙니다.

가정 단가로 계산한 1,000회 호출
항목총 사용량가정 비용
입력2,000 × 1,000 = 200만 토큰2달러
출력500 × 1,000 = 50만 토큰2달러
합계입력·출력만 포함4달러

질문 한 번이 API 한 번은 아닐 수 있다

사용자 요청마다 초안 생성과 검토 호출을 각각 실행한다면 두 호출을 더해야 합니다. 위와 같은 크기의 호출을 요청당 두 번 수행하는 가정에서는 1,000건의 사용자 요청이 2,000회 호출, 8달러가 됩니다. 재시도·도구 호출·대화 기록이 추가될 때는 각 호출의 실제 사용량 기록으로 바꿔 계산하세요. Google의 Gemini API 요금표도 입력·출력 외에 캐시와 검색 연동 등 항목을 별도로 안내합니다.

전용 서버는 한산한 시간도 계산 대상

Hugging Face Inference Endpoints는 인스턴스 종류와 시간당 단가를 제시하며 실제 비용은 분 단위로 계산합니다. 정상 배포된 엔드포인트의 초기화·실행 자원이 과금 대상이라고 설명합니다. 가상의 서버 1대를 시간당 0.5달러로 하루 24시간, 30일 유지하면 360달러입니다. 질문이 적어도 계속 가동한다는 조건에서는 이 비용이 남습니다. 이 숫자는 실제 인스턴스 요금이 아닙니다.

절약 실험은 완료된 작업 한 건으로 비교

원고 분류처럼 반복되는 업무라면 같은 검증용 입력 묶음으로 두 설정을 비교하세요. 기록할 것은 총 비용, 올바르게 완료된 건수, 재시도 횟수와 응답 시간입니다. 100건 처리비가 1달러인데 80건만 쓸 수 있다면 사용 가능한 결과 한 건당 비용은 0.0125달러입니다. 싼 모델로 바꾼 뒤 재작업이 늘면 토큰 단가만 낮아진 것이지 전체 업무 비용이 줄었다고 볼 수 없습니다.