LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling
- 발행일
- 출처
- arXiv
- 논문 번호
- 184
- 분야
- Reasoning / Test-Time Scaling
- arXiv 번호
- 2605.08083
AutoTTS 프레임워크는 설계 문제를 알고리즘적 탐색으로 재구성하여 대형 언어 모델(LLM)을 위한 테스트 타임 스케일링(TTS) 전략의 발견을 자동화한다.
AutoTTS 프레임워크는 설계 문제를 알고리즘적 탐색으로 재구성하여 대형 언어 모델(LLM)을 위한 테스트 타임 스케일링(TTS) 전략의 발견을 자동화한다. 발견된 전략들은 일관되게 우수한 정확도-비용 트레이드오프를 달성하여, 수작업으로 만든 베이스라인 대비 토큰 소비를 최대 69.5%까지 줄이는 동시에 종종 최고 정확도를 향상시키고 다양한 LLM과 벤치마크에 걸쳐 견고한 일반화 성능을 보인다.
핵심 요약
- 대형 언어 모델(LLM)을 위한 테스트 타임 스케일링(TTS) 전략은 통상적으로 수작업 설계와 휴리스틱 튜닝으로 개발된다.
- 이러한 인간의 직관에 대한 의존은 복잡한 연산 배분 정책의 탐색을 제한하며 인간의 인지 편향에 취약하다.
- 수작업 방식은 종종 특정 과제나 모델에 한정된 전략을 낳아, 더 넓은 범위에 걸쳐 최적이 아닌 정확도-비용 트레이드오프를 초래한다.
- AutoTTS는 테스트 타임 스케일링(TTS)을 컨트롤러 합성 문제로 정식화하며, 여기서 탐색자 LLM이 코드로 정의된 정책을 반복적으로 제안하고 개선한다.
- 이 방법은 오프라인 리플레이 환경을 활용해 추론 궤적을 사전에 수집함으로써, 실시간 LLM 호출 없이도 후보 컨트롤러를 저렴하고 결정론적으로 평가할 수 있게 한다.
- 이 프레임워크는 하이퍼파라미터의 탐색 공간을 단순화하기 위해 베타 파라미터화를 도입하고, 견고한 발견을 위한 피드백으로 세밀한 실행 추적을 제공한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.