The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More

발행일
출처
arXiv
논문 번호
134
분야
LLMs / Economics
arXiv 번호
2603.23971

광고된 토큰당 API 가격이 실제 RLM 추론 비용을 오해하게 만드는 대리지표가 될 수 있음을 보여주는 비용 감사 논문이다. 숨겨진 사고 토큰 사용량이 청구액을 좌우하기 때문이다.

이 논문은 공시된 API 가격이 추론 언어 모델(RLM) 사용의 실제 비용을 예측하는지 연구하며, 수학, 과학 QA, 코딩, 시각 추론, 다영역 추론에 걸친 9개 과제에서 8개의 프런티어 RLM을 감사한다. 광고된 토큰 가격이 더 낮은 모델이 어떤 워크로드 전체에서는 비용이 더 많이 드는 경우를 가격 역전으로 정의하며, 252개 모델 쌍과 과제 비교의 21.8%에서 이를 발견했고 역전 폭은 최대 28배에 달했다. 그 메커니즘은 프롬프트 길이가 아니라 청구되는 사고 토큰 소비의 이질성이다. 동일한 질의가 한 모델이 다른 모델보다 약 900% 더 많은 사고 토큰을 쓰게 만들 수 있으며, 사고 토큰 비용을 제거하면 역전이 70% 줄고 Kendall 순위 상관이 0.563에서 0.873으로 상승한다. 동일한 질의를 반복 실행해도 사고 토큰이 최대 9.7배까지 변동하므로, 저자들은 가격표만으로 모델을 선택하기보다 워크로드별 비용 감사와 요청당 비용의 투명한 보고를 주장한다.

핵심 요약

  • 실제 비용을 입력 토큰 비용에 출력 토큰 비용을 더한 것으로 정식화하되 사고 토큰을 청구 대상 출력에 포함시키고, 공시 가격 기준 순위를 측정된 총비용 기준 순위와 비교하는 방법을 쓴다.
  • GPT-5.2, Gemini 3 Flash/Pro, Claude Opus/Haiku, Kimi, MiniMax 변형을 포함한 8개 RLM을 9개 데이터셋과 11,872개 질의에 걸쳐 감사하며, 2026년 2~3월 가격을 적용해 수집했다.
  • 252개 쌍별 비교 중 21.8%가 가격 역전을 보였다. Gemini 3 Flash는 GPT-5.2보다 공시 가격이 78% 저렴하지만 전체 비용은 22% 더 비싸며, 인용된 극단 사례에서는 MMLUPro에서 Claude Haiku 4.5보다 28배 더 비쌌다.
  • RLM 조달은 실제 워크로드를 벤치마킹하고 요청당 프롬프트, 사고, 최종 생성 비용 내역을 공개해야 한다. 의미 기반이나 길이 기반 예측 변수조차 확률적인 사고 토큰 변동에 직면하기 때문이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)