AI 예산이 타당한지 묻는 독자에게, 나는 일반 업무의 추가 투자는 실제로 쓸 업무를 확보하고 검수비를 낮추는 쪽에 먼저 배정하자고 답하겠다. 공용 GPU와 독자 모델에는 별도의 중요한 역할이 있다. 다만 장비 대수와 모델 순위만으로 다음 증액까지 정당화해서는 안 된다.

앞선 예산 범위 설명에 이어 이번에는 그 판단을 계산으로 시험했다. 국가 예산 전체에 수익률 하나를 붙이는 대신 질문을 좁혔다. 같은 모델 계열로 같은 길이의 요청을 처리한다면, 상시 임대한 GPU가 종량제 API보다 싸려면 얼마나 바빠야 할까? 그리고 그 절감액은 사람이 답을 확인하는 시간으로 얼마일까?

계산의 결론은 두 단계다. 유용한 일을 하는 시간의 비율이 33.5%를 넘으면 전용 임대가 유리해지는 기준 사례가 있다. 성능과 운영비 가정을 바꾸면 그 문턱은 59.8%로 올라간다. 그런데 전용 임대가 확실히 유리한 한 사례에서도 요청당 절감액은 가상의 인건비로 추가 검수 0.11초에 불과하다. 두 방식의 합격률이 같을 때 검수시간 차이가 이 정도만 나도 가격 우위가 뒤집힐 수 있다는 뜻이다. 인프라 효율을 무시하자는 말이 아니다. 어느 비용을 줄여야 실제 성과가 커지는지 순서를 세우자는 말이다.

먼저 확인한 사실과 내가 넣은 가정을 나눈다

공개 가격 확인일은 2026년 10월 6일이다. 모든 금액은 세금 제외 미국 달러다.

  • 가격 자료: Lambda의 2×H100 SXM 플랜은 GPU당 시간당 $4.19다. Together의 Llama 3.3 70B Instruct Turbo FP8는 입력·출력 각각 100만 토큰당 $1.04다. Lambda 가격 · Together 모델 가격
  • 성능 자료: NVIDIA의 NIM 1.8.0, FP8 TP2, 2×H100 공개 측정에서 입력·출력 각 1,000토큰, 동시 요청 150의 전체 출력 처리량은 초당 3,342.67토큰이다. TTFT는 428.54ms, ITL은 44.44ms다. 측정 장비는 DGX H100이며 Lambda에서 재현한 결과가 아니다. 성능표 · 지표 정의
  • 비교의 자격: 같은 모델 계열과 FP8만 맞췄다. 실제 체크포인트·출력 품질·서비스 수준의 동등성은 검증하지 않았다. 한국어는 이 모델이 명시한 지원 언어에 없으며, 한국 공공업무용 모델 추천도 아니다. Meta 모델 카드
  • 분석자의 가정: 바쁜 시간의 처리량을 공개 수치의 70%로 낮추는 경우, 임대료 외 비용을 25% 더하는 경우, 검수 인건비를 시간당 $30로 두는 경우를 계산했다. 어느 것도 현장에서 관측한 값이 아니다.

비교 대상은 상시 클라우드 임대와 종량 추론 서비스다. 국가가 GPU를 구매하는 사업의 총소유비용 분석은 아니다. 구매를 평가하려면 건설·전력·냉각·인력·교체·잔존가치와 계약 기간까지 다시 넣어야 한다. 이 글의 비율을 국가 예산에 곱해 “몇 조 원 절감”으로 바꾸면 계산의 범위를 벗어난다.

33.5%는 장비 사용률 목표가 아니라 수요를 입증할 문턱이다

입력과 출력이 각각 1,000토큰인 요청 하나의 API 비용은 $0.00208이다. 두 GPU 임대료는 시간당 $8.38다. 공개 성능이 그대로 재현되고 추가 운영비가 없다는 유리한 기준선에서, 유용하게 바쁜 시간의 비율을 u라고 하면 전용 비용은 요청당 약 $0.00069638 ÷ u가 된다.

여기서 u의 분모는 돈을 낸 시간이다. 분자는 정해진 부하로 실제 쓸 일을 처리한 시간이다. GPU 관리 화면에 찍힌 연산 사용률과는 다르다. 잘못된 답을 계속 생성하거나 재실행하는 장비도 바빠 보일 수 있다. 또한 작은 요청이 하루 종일 흩어져 들어오는 것과 충분한 동시 요청을 짧게 모아 처리하는 것은 같은 조건이 아니다.

표 1. 외부에서 관측한 비용이 아닌 자체 조건부 계산. 요청 길이와 업무 품질이 같다는 전제이며 추가 검수비는 제외했다.
조건요청 1,000건당 전용 비용비교 기준
기준선, 유용한 바쁜 시간 25%$2.786API $2.080
기준선, 유용한 바쁜 시간 60%$1.161API $2.080
처리량 70%·추가 비용 25%, 바쁜 시간 60%$2.073API $2.080

기준선의 손익분기는 33.5%다. 처리량 70%·추가 비용 25%를 적용하면 59.8%가 된다. 마지막 행은 중요한 경고다. “60%면 충분하다”는 한 문장을 정책 지표로 삼을 수 없다. 조금만 조건이 달라져도 절감 여유가 거의 사라진다.

유용한 작업 시간이 서빙 비용을 바꾼다

세로축: 시도한 요청 1,000건당 미국 달러 비용. 가로축: 유료 시간 중 유용한 작업 시간의 비율.

  • A · 청록색 실선 · 전용 임대의 이상적 조건: 기준 처리량을 모두 재현하고 추가 운영비가 없는 경우.
  • B · 주황색 실선 · 전용 임대의 가정: 처리량 70% 재현, 추가 운영비 25%.
  • C · 짙은 점선 · 기준 요청의 API 비용.
유료 시간 중 유효 작업 시간 비율이 10%에서 100%로 증가할 때 요청 1,000건당 계산 비용을 나타낸 선 그래프. API 기준 비용은 2.08달러로 일정하다. 이상적 전용 인프라 비용은 6.96달러에서 0.70달러로 줄며 33.5%에서 API와 같아진다. 처리량 70%, 추가비용 25% 조건에서는 12.44달러에서 1.24달러로 줄며 59.8%에서 같아진다. 관측된 전체 서비스 비용이나 ROI 예측이 아닌 시나리오 계산이다. 계열 표기: A = 이상적 조건의 전용 인프라 서빙; B = 전용 인프라: 처리량 70%, 추가비용 25%; C = API 기준선.

자체 계산한 비교 값의 근삿값

C · 요청 1,000건당 API 비용
약 $2.08
A · 이상적 전용 임대의 손익분기
유용한 작업 시간 약 33.5%
B · 조정 조건 전용 임대의 손익분기
유용한 작업 시간 약 59.8%
  • 유용한 작업 시간은 비용을 지불한 시간 중 실제 쓸 일을 처리한 시간이며 GPU 관리 화면의 사용률이 아니다.
  • 조건부 계산이다. 임대 환경의 성능 재현, 같은 업무 품질과 서비스 수준은 입증하지 않았다.
그림 1. 같은 요청의 비용도 유용한 일감의 밀도에 따라 순위가 바뀐다. 70% 처리량과 25% 추가 비용은 민감도 가정이다. 원가격·성능 출처는 위 입력 자료, 곡선은 자체 계산. 차트 크게 보기 · 계산 데이터 (CSV)

이 모형은 쉬는 시간과 바쁜 시간의 성능을 분리한 근사다. 실제 수요가 줄면 동시성도 함께 낮아질 수 있다. 그렇다면 같은 곡선을 따라 내려가는 것이 아니라 곡선 자체가 바뀐다. 조달 전에 필요한 것은 “우리 GPU가 몇 퍼센트 돌아갈까”라는 추측보다, 어느 업무가 언제 얼마나 들어오고 함께 처리할 수 있는지 보여 주는 수요 기록이다.

첫 토큰이 빠르다고 업무가 빨리 끝나지는 않는다

기준 사례의 지표를 이용하면 전체 출력을 받는 시간은 대략 44.8초다. 첫 토큰이 1초 안에 나오는 것과 1,000토큰의 답변이 1초 안에 끝나는 것은 전혀 다른 약속이다. 평균성 공개 지표는 혼잡 시간대의 p95·p99 응답시간도 보장하지 않는다.

따라서 “최고 처리량에서 토큰이 싸다”는 사실만으로 대화형 서비스를 설계하면 안 된다. 사용자에게 필요한 전체 완료시간을 먼저 정하고, 그 조건을 만족하는 처리량으로 원가를 다시 구해야 한다. API 역시 같은 시험을 받아야 한다. 이 글에서는 어느 쪽이 실제 한국 업무에서 더 빠른지 측정하지 않았다.

한국어 문서 요약, 짧은 분류, 긴 계약서 검토를 하나의 요청 수로 합치는 것도 위험하다. 입력을 읽는 부담과 출력 길이가 달라지면 한 장비의 생산량도 달라진다. 공용 GPU의 이점은 서로 다른 수요를 잘 모으는 데서 생길 수 있지만, 보안 구획이나 짧은 응답시간 요구가 그 결합을 막을 수도 있다.

배치 할인은 양쪽의 기다릴 권리를 맞춰 비교한다

Together의 해당 모델 비동기 Batch 할인은 50%이며, 24시간은 최선 노력 목표다. 이 조건을 실시간 API 가격에 섞으면 안 된다. Batch 문서

공정한 비교를 위해 전용 쪽도 지연 제한을 풀었다. 공개표의 동시 요청 250 행, 초당 출력 4,167.39토큰을 사용했다. 이것이 전용 비동기 처리의 최적 성능이라는 뜻은 아니다. 같은 성능표

표 2. 각 조건에서 전용 임대가 API와 같은 비용이 되는 유용한 바쁜 시간 비율. 배치 행은 API 가격뿐 아니라 전용 처리량도 바꿨다.
서비스 조건기준선 손익분기처리량 70%·추가 비용 25%
기본 비교33.5%59.8%
양쪽 모두 지연 제약을 완화한 배치 비교53.7%95.9%

API 가격만 절반으로 낮추고 전용 성능은 그대로 두면 더 극적인 숫자를 만들 수 있다. 하지만 그것은 공정한 배치 비교가 아니다. 여기서 읽을 결론은 “API가 언제나 승리한다”가 아니라 기다릴 수 있는 업무일수록 가격과 스케줄링을 함께 비교해야 한다는 것이다. 수요를 모으고 밀어 넣는 운영 능력이 전용 자원의 경제성을 결정한다.

추가 검수시간이 순위를 바꾸는 조건

기준선에서 유용한 바쁜 시간이 60%라면 전용 임대는 요청당 약 $0.000919를 아낀다. 시간당 $30라는 가상의 검수 인건비로 바꾸면 0.11초다. 같은 가정에서 검수 1초는 $0.00833다. 요청 1,000건을 놓고 보면 인프라 절감액은 약 $0.92, 검수 1초 추가의 비용은 약 $8.33다.

추가 검수비가 서빙 절감액을 넘는 조건

가로축: 시도한 요청 1,000건당 미국 달러 비용. 두 막대는 0부터 시작하는 같은 축을 쓴다.

  • A · 청록색 막대 · 유용한 작업 시간 비율 60%에서 이상적 전용 임대가 API보다 아끼는 서빙 비용.
  • B · 파란색 막대 · 전용 임대 쪽에서 API보다 요청당 검수가 1초 더 필요할 때의 추가 비용. 시간당 $30 인건비를 가정했다.
두 막대는 업무 합격률이 같다고 가정한 조건부 계산을 요청 1,000건당 금액으로 비교한다. 유효 작업 시간 비율 60%인 이상적 전용 인프라 조건의 API 대비 서빙 절감액은 약 0.92달러이다. 시간당 30달러 인건비를 가정하면 API보다 전용 인프라에서 요청당 검토가 1초 더 들 때 추가비용은 약 8.33달러로 절감액의 9.06배이다. 요청당 약 0.11초의 추가 검토만으로 절감액이 상쇄된다. 동일한 검토비는 상쇄되며 서빙 자체의 절감액은 유지된다. 실제 검토 시간 차이가 있다는 주장은 아니다. 계열 표기: A = 이상적 전용 인프라의 API 대비 서빙 절감액; B = API보다 전용 인프라에서 요청당 검토가 1초 더 들 때의 추가비용.

조건부 자체 계산의 근삿값

A · 요청 1,000건당 서빙 절감액
약 $0.92
B · 요청 1,000건의 추가 검수 1초 비용
약 $8.33
서빙 절감액을 상쇄하는 추가 검수시간
요청당 약 0.11초
  • 두 서비스의 총비용 비교가 아니라 서빙 절감액과 추가 검수비의 비교다.
  • 합격률은 같다고 가정한다. 같은 검수비는 비교에서 상쇄되며 서빙 절감액은 그대로 남는다.
  • 추가 검수시간과 인건비는 가정이며 실제 검수시간 차이를 관측한 결과가 아니다.
그림 2. 시간당 $30라는 가정 아래, 기준선의 60% 바쁜 시간에서 얻는 절감액은 전용 쪽의 추가 평균 검수 약 0.11초와 같다. 합격률은 같다고 가정한다. 실제 임금·검수시간·모델 간 품질 차이를 측정한 결과가 아니다. 차트 크게 보기 · 계산 데이터 (CSV)

이 문턱은 두 방식의 합격률이 같고, 전용 쪽에 추가로 드는 평균 검수시간의 차이를 뜻한다. 검수시간이 같으면 공통 비용은 비교에서 상쇄되고 전용의 절대 절감액은 그대로 남는다. 어느 쪽에 추가 검수가 실제로 필요한지는 측정하지 않았다. 합격률까지 다르면 아래의 합격 업무당 비용을 각각 계산해야 한다.

이는 국내 모델에 불리한 주장만은 아니다. 국내 업무에 더 잘 맞는 모델이 검수와 수정 시간을 줄인다면, 추론 단가가 높아도 전체 비용은 낮아질 수 있다. 반대로 값싼 모델이 미묘한 오류를 더 만들면 토큰 절감액은 쉽게 사라진다. 그러므로 사업 평가의 단위를 검수까지 마치고 합격한 업무 1건의 총비용으로 바꾸는 편이 낫다.

간단한 회계식은 다음과 같다.

합격 업무당 비용 = (추론비 + 검수시간 × 시간당 인건비 ÷ 3,600 + 기타 업무비) ÷ 합격률

같은 평가 기준으로 전체 시도의 비용과 합격 건수를 집계한다는 뜻이다. 실패를 독립적으로 반복하면 언젠가 성공한다는 가정은 없다. 안전과 법적 적합성은 평균 비용으로 상쇄할 수 없는 선행 조건이다.

새 모델 개발도 이 단위로 질문할 수 있다. 동일한 단기 자원 중 25%를 개발에 쓰고 나머지를 서비스에 쓴다면, 합격률이 같을 때 더 많은 업무를 처리하려면 검수 등을 포함한 시도당 서비스 비용을 25% 넘게 낮춰야 한다. 합격률의 비율이 기존의 1.10배라면 같은 시도당 비용은 기존의 82.5% 미만이어야 한다. 이는 개발하면 그렇게 좋아진다는 전망이 아니다. 단기 서비스 효과를 명분으로 내세울 때 제안자가 넘어야 하는 문턱이다. 장기 연구 가치가 목적이라면 그 가치는 별도로 평가해야 한다.

가장 강한 반론은 API가 팔지 않는 능력이다

여기까지의 계산만으로 연구용 GPU나 독자 모델 투자를 줄이자고 결론내리면 제품을 잘못 비교한 셈이다. 연구자는 완성된 답 외에도 가중치 변경, 새 구조의 학습, 모델 내부 실험, 비공개 데이터의 통제, 외부 서비스가 끊겼을 때의 복구 능력이 필요할 수 있다. 완성된 답변을 주는 API 계약이 이 권한까지 제공하는 것은 아니다.

또 연구 장비와 운영 인력은 처음 투자한 기관 밖으로 지식과 기술을 퍼뜨릴 수 있다. 현재 추론 수요가 작다는 이유로 이런 투자를 모두 거절하면, 앞으로 필요한 능력을 배울 기회도 사라질 수 있다. 따라서 목적과 이용자가 분명한 연구·통제 역량에는 지금도 제한된 규모의 투자를 할 이유가 있다. 모든 가치가 확실해질 때까지 기다리자는 입장은 아니다.

대신 대안을 넓혀야 한다. 직접 소유뿐 아니라 원시 클라우드 연산 임대, 예약 용량, 연구 바우처, 국내 민간 공급, 이식 가능한 소프트웨어와 운영 인력도 비교 대상이다. 필요한 권한을 더 싸게 살 수 있다면 소유 자체에 프리미엄을 줄 이유는 약해진다.

주권을 보험으로 설명하려면 어떤 사고를 얼마나 막는지도 보여 줘야 한다. 국내에 외국산 GPU를 두어도 부품·소프트웨어·전력 의존은 남을 수 있다. 공급 중단 대비라면 최선의 실행 가능한 대안과 비교한 연간 추가 비용과 추가로 회피할 수 있는 손실을 같은 기간으로 비교하고, 복구 시간과 훈련 결과를 제시해야 한다. 예상 손실액 하나로 국가안보를 모두 평가할 수는 없지만, “주권”이라는 단어만으로 보험료와 보장 범위를 생략할 수도 없다.

그래서 세 사업을 연결하되 증액의 조건은 다르게 둔다

내가 택할 순서는 다음과 같다.

  1. 일반 업무 도입은 경쟁 구매와 작은 실험으로 시작한다. 실제 요청 기록, 블라인드 한국어 평가, 검수시간과 반복 사용을 남긴다. 데이터 정리와 업무 설계가 막혀 있다면 그 병목부터 푼다.
  2. 공용 연산은 확인된 수요와 접근 문제를 해결하도록 늘린다. 대기시간, 배정 뒤 미사용, 소규모 팀의 접근, 민간 대안으로 할 수 없었던 추가 연구를 본다. 대기 수요와 동등 서비스의 총비용이 입증되면 증설의 근거는 강해진다.
  3. 독자 모델은 대체가 어려운 능력으로 평가한다. 특정 업무의 검수비를 줄이는지, 외부 대안으로 할 수 없던 작업을 가능하게 하는지, 수정·이식·복구를 실제로 시연하는지 묻는다. 일반 성능 순위는 그 답의 일부다.

세 사업은 경쟁하는 통장인 동시에 서로의 성과를 만드는 보완재다. 실제 업무가 없으면 GPU가 쉬고, 연산 접근이 막히면 준비된 연구가 기다린다. 어느 병목이 심한지 측정하지 않은 채 균등 배분이나 특정 비율을 정하는 것은 근거가 없다.

내 판단이 바뀔 조건도 분명하다. 공용 자원에 가치 있는 대기 수요가 쌓이고, 같은 품질·꼬리 지연·장애 대응에서 총비용이 낮다는 관측이 나오면 연산 확대를 더 지지하겠다. 국내 모델이 검수비를 충분히 줄이거나 대체 불가능한 통제권을 입증하면 개발 비중을 높이는 편에 서겠다. 반대로 쉬는 장비와 낮은 반복 사용만 남으면 다음 구매를 늦추고 계약과 운영 방식을 바꿔야 한다.

내 결론은 AI 투자의 다음 1원을 더 엄격하게 쓰자는 것이다. 추가 GPU가 필요한지, 쓸 업무가 필요한지, 믿고 쓸 정확도가 필요한지 먼저 보여 주는 사업에 돈을 더 주자. 지금의 자료로는 업무와 검수의 병목을 먼저 확인하는 것이 가장 설득력 있는 출발점이다.

계산을 직접 바꾸어 보려면

공개 재현자료 (ZIP)에는 계산식, 실행 코드, 선택한 입력 CSV와 원출처가 있다. 운영 성능·인건비·검수시간을 자신의 관측값으로 바꾸면 결론이 어디에서 뒤집히는지 확인할 수 있다. 이 글은 한국 조달 총비용, 실제 한국어 품질, 국가 사업의 수익률이나 최적 예산 비율을 추정하지 않았다.

관련 읽기: AI 예산에서 서로 다른 범위를 구분하기. 숫자의 범위를 먼저 확인한 뒤, 이 글의 비용 문턱과 별도 역량 평가를 적용하는 순서가 좋다.