> ## Content Index
> Fetch the complete content index at: https://zerodraftlab.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# AI 모델 순위는 결과당 비용으로 갈린다
- URL: https://zerodraftlab.com/intelligence-per-dollar/
- Published: 2026-07-13T10:23:44.000Z
- Updated: 2026-09-15T08:35:54.000Z
- Author: JooMong

AI 모델 순위표는 오랫동안 한 줄로 세워졌다. 가장 어려운 문제를 가장 많이 맞힌 모델이 가장 좋은 모델이었다. 가격과 속도는 그다음 문제였다.

이 기준이 바뀌고 있다. 이제 중요한 질문은 “누가 가장 높은 점수를 받았는가?”가 아니라 **“같은 결과를 얻는 데 얼마를 썼는가?”**다.

Tom Tunguz는 이를 ‘달러당 지능’이라고 부른다. 모델 벤치마크가 정답률 하나의 경쟁에서 성능과 그 성능을 얻는 데 쓴 자원을 함께 보는 2차원 경쟁으로 이동한다는 뜻이다. 최고점이 아니라 비용 대비 성능의 경계에 있는 모델이 선택받는다.

## Microsoft가 토큰 사용량을 성적표에 넣은 이유

Microsoft는 MAI-Code-1-Flash를 발표하면서 코딩 벤치마크의 성공률 옆에 평균 솔루션 토큰 사용량을 함께 공개했다. 자사 GitHub Copilot 프로덕션 하네스에서 Claude Haiku 4.5와 비교한 결과, 네 가지 코딩 평가 모두 더 높은 성공률을 기록했고 SWE-Bench Verified에서는 최대 60% 적은 토큰으로 문제를 풀었다고 주장했다.

이 수치는 그대로 중립적 모델 순위가 되지는 않는다. Microsoft가 자기 모델을 훈련한 환경과 가까운 자체 프로덕션 하네스에서 수행한 평가다. 다른 하네스, 다른 작업 분포, 독립 평가기관에서도 같은 우위가 재현되는지는 별도로 확인해야 한다.

그럼에도 발표 형식은 중요하다. 성공률만 보여주지 않고 그 성공을 만드는 데 든 토큰을 같은 표에 올렸기 때문이다. 모델이 답을 맞혔더라도 세 배의 토큰과 더 긴 대기시간을 요구한다면, 대규모 프로덕션에서는 전혀 다른 제품이 된다.

## 토큰을 많이 썼다고 깊게 일한 것은 아니다

추론 토큰이 늘면 어려운 문제를 더 오래 탐색할 수 있다. 복잡한 버그나 넓은 코드 변경에는 실제로 더 많은 사고가 필요하다. 따라서 토큰이 많다는 이유만으로 나쁜 모델이라고 결론 내릴 수는 없다.

하지만 토큰 사용량을 노력의 증거로 착각해서도 안 된다. 같은 가설을 반복하고, 불필요하게 파일을 다시 읽고, 실패한 접근을 되풀이하고, 장황한 중간 설명을 만드는 데도 토큰이 든다. 사람의 야근 시간이 업무의 질을 보장하지 않듯, 긴 추론 기록도 결과의 질을 보장하지 않는다.

그래서 모델 계층에서 봐야 할 것은 토큰 수 자체가 아니다. **일정한 성공률을 만드는 데 필요한 토큰과 달러**다. 싼 토큰을 많이 태워 실패하는 모델도, 높은 점수를 위해 비용을 무한정 쓰는 모델도 좋은 선택이 아니다.

## 애플리케이션은 한 단계 위의 단위를 팔아야 한다

사용자는 토큰을 사지 않는다. 고객지원 팀은 해결된 문의를 사고, 개발팀은 머지할 수 있는 PR을 사고, 운영팀은 닫힌 티켓을 산다. 따라서 애플리케이션 계층의 경쟁 단위는 토큰당 가격이 아니라 **수락된 결과 한 건당 총비용**이어야 한다.

여기까지 받아들이면 “어떤 모델이 가장 좋은가?”라는 질문도 불완전해진다. 같은 모델이라도 도구, 프롬프트, 컨텍스트 선별, 재시도 정책, 검증 절차와 결합되는 순간 결과당 비용이 달라진다. 모델 선택은 시스템 설계의 일부일 뿐이다.

그러면 다음 질문이 남는다. 결과 한 건의 비용에는 정확히 무엇을 넣어야 하는가?

결과는 모델이 답을 출력했다는 뜻이 아니다. 사람이 실제로 받아들여 다음 단계로 넘길 수 있는 상태가 됐다는 뜻이다. PR이라면 테스트와 리뷰를 통과해 머지할 수 있어야 하고, 고객문의라면 재문의 없이 문제가 해결돼야 하며, 티켓이라면 사람이 뒤에서 다시 처리하지 않아도 닫혀야 한다.

이 정의를 쓰면 결과당 비용의 분자가 커진다.

> 결과당 비용 = 모델 추론비 + 도구 호출비 + 재시도 비용 + 사람의 검토비 + 실패 복구비를 수락된 결과 수로 나눈 값

토큰 가격표만 비교할 때는 보이지 않던 비용이 드러난다. 작은 모델이 한 번에 성공하면 경제적이다. 하지만 여러 번 재시도하고 사람이 긴 수정 작업을 해야 한다면 비싼 모델의 단발 성공보다 총비용이 높을 수 있다. 반대로 가장 강한 모델을 모든 작업에 고정하면 간단한 분류와 조회에도 과도한 추론비를 낸다.

## 모델보다 하네스가 경제성을 결정한다

Microsoft의 발표가 흥미로운 지점도 여기에 있다. 회사는 MAI-Code-1-Flash를 GitHub Copilot의 실제 하네스와 함께 훈련했다고 강조한다. 모델만 따로 개선한 것이 아니라 모델이 파일을 읽고, 도구를 쓰고, 수정을 제출하는 환경에 맞춰 공동 최적화했다.

이것은 자체 평가라는 한계인 동시에 애플리케이션 사업자가 주목해야 할 단서다. 프로덕션 성능은 모델의 고유 능력만으로 결정되지 않는다. 필요한 컨텍스트를 얼마나 적게 정확히 넣는지, 어떤 도구를 언제 열어주는지, 실패를 얼마나 빨리 감지하는지, 검증을 모델 밖의 결정적 코드로 얼마나 옮겼는지가 비용을 좌우한다.

예를 들어 코딩 에이전트가 저장소 전체를 반복해서 읽는다면 모델 가격을 낮춰도 낭비는 남는다. 반대로 변경 범위를 좁히고 관련 테스트를 먼저 찾으며, 정적 검사와 테스트 실행을 하네스가 책임지게 하면 더 작은 모델도 높은 성공률을 낼 수 있다. 지능을 싸게 사는 일은 할인된 모델을 찾는 일이 아니라 불필요한 추론을 시스템에서 제거하는 일에 가깝다.

## 정확도와 비용 사이에는 세 가지 함정이 있다

첫째는 **토큰을 적게 쓰는 것을 무조건 효율로 보는 것**이다. 충분히 생각하지 않아 실패율이 높아지면 절약한 토큰보다 재시도 비용이 커진다. 효율은 짧은 답이 아니라 수락된 결과까지의 짧은 경로다.

둘째는 **벤치마크 통과를 업무 완료로 보는 것**이다. 패치를 만들었다는 사실과 배포 가능한 PR을 완성했다는 사실은 다르다. 테스트, 보안 검사, 리뷰 수정, 회귀 대응까지 포함해야 실제 결과당 비용이 나온다.

셋째는 **평균값 하나로 모든 작업을 라우팅하는 것**이다. 단순한 문서 수정과 여러 서비스에 걸친 장애 복구는 필요한 추론량이 다르다. 좋은 시스템은 쉬운 작업에는 빠르고 싼 모델을 쓰고, 불확실성과 실패 비용이 커질 때만 더 강한 모델과 더 긴 추론을 배정한다.

## 새로운 해자는 모델 순위가 아니라 비용 곡선이다

모델 가격과 순위는 빠르게 바뀐다. Tunguz가 2026년 6월에 제시한 모델별 비용 비교도 당시의 스냅숏일 뿐이다. 몇 달 뒤에는 이름과 숫자가 모두 달라질 수 있다.

그러나 토큰당 가격에서 결과당 가격으로 측정 단위가 이동하는 방향은 더 오래 남는다. 기업이 AI 사용량을 늘릴수록 작은 비효율도 예산, 지연시간, 사람의 검토 부담으로 증폭되기 때문이다.

앞으로 경쟁력 있는 AI 애플리케이션은 “최고 모델을 쓴다”고 말하는 제품이 아닐 가능성이 크다. 작업 난이도를 분류하고, 필요한 컨텍스트만 공급하고, 모델을 동적으로 라우팅하고, 결과를 자동 검증하며, 실패 비용까지 측정하는 제품일 것이다. 모델이 바뀌어도 이 시스템의 학습은 남는다.

**가장 똑똑한 모델이 아니라, 수락 가능한 결과를 가장 싸게 반복 생산하는 시스템이 이긴다.**

---

출처: Tom Tunguz, [Intelligence Per Dollar](https://www.tomtunguz.com/tokens-per-result/?ref=zerodraftlab.com); Microsoft AI, [Introducing MAI-Code-1-Flash](https://microsoft.ai/news/introducingmai-code-1-flash/?ref=zerodraftlab.com). Microsoft의 성공률과 토큰 절감 수치는 자체 GitHub Copilot 프로덕션 하네스 평가에 따른 회사 발표이며, 독립 벤치마크 결과로 일반화하지 않았습니다.