Beyond GPT-5: Making LLMs Cheaper and Better via Performance-Efficiency Optimized Routing
- 발행일
- 출처
- arXiv
- 논문 번호
- 073
- 분야
- Routing / Efficiency
- arXiv 번호
- 2508.12631
Avengers-Pro는 모델 앙상블에서 동적으로 선택하여 성능-효율 트레이드오프를 최적화하는, 대규모 언어 모델을 위한 테스트 시점 라우팅 프레임워크를 소개한다.
Avengers-Pro는 모델 앙상블에서 동적으로 선택하여 성능-효율 트레이드오프를 최적화하는, 대규모 언어 모델을 위한 테스트 시점 라우팅 프레임워크를 소개한다. 이 시스템은 GPT-5-medium 대비 평균 정확도가 7% 높았으며, 비슷한 성능을 유지하면서 추론 비용을 27% 절감하여 LLM 시스템의 새로운 파레토 프런티어를 확립했다.
핵심 요약
- 높은 성능(정확도, 추론)과 연산 효율(비용, 지연)의 균형을 맞추는 것은 대규모 언어 모델 발전의 핵심 과제다.
- 최첨단 독점 LLM은 흔히 상당한 운영 비용과 자원 요구를 수반하여, 광범위하고 비용 효율적인 배포를 제약한다.
- 기존 LLM용 테스트 시점 라우팅 방법은 흔히 종합 성능에만 주로 집중하거나, 추가 신경망의 복잡한 학습을 요구하여 오버헤드를 더한다.
- 각 질의에 대해 최적 모델을 동적으로 선택하도록 다양한 LLM 앙상블을 조율하는 테스트 시점 라우팅 프레임워크 Avengers-Pro를 개발했다.
- 이 프레임워크는 질의 임베딩, 질의의 k-평균 클러스터링, 클러스터별 모델 단위의 성능-효율 점수화라는 세 가지 경량의 비지도 연산에 의존한다.
- 온라인 추론 중에 들어오는 질의를 임베딩하여 가장 가까운 클러스터에 할당하고, 트레이드오프 파라미터 α로 조정 가능한 종합 성능-효율 점수가 가장 높은 모델로 라우팅한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.