On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
- 발행일
- 출처
- arXiv
- 논문 번호
- 175
- 분야
- Agents / Reinforcement Learning
- arXiv 번호
- 2605.02572
이 실증 연구는 내재적 과제 호라이즌 길이를 대규모 언어 모델 에이전트 훈련의 근본적 병목으로 규명하며, 더 긴 호라이즌이 심각한 훈련 불안정성과 성능 붕괴를 유발함을 입증한다.
이 실증 연구는 내재적 과제 호라이즌 길이를 대규모 언어 모델 에이전트 훈련의 근본적 병목으로 규명하며, 더 긴 호라이즌이 심각한 훈련 불안정성과 성능 붕괴를 유발함을 입증한다. 매크로 액션과 하위 목표 분해 같은 호라이즌 축소 기법을 적용하면 훈련이 효과적으로 안정화되고 성능이 향상되어, 이전에 보지 못한 더 긴 과제로의 일반화가 가능해짐을 보여준다.
핵심 요약
- 상호작용 에이전트로 배치된 대규모 언어 모델(LLM)은 다단계의 긴 호라이즌 실세계 과제에서 어려움을 겪는다.
- 선행 연구는 LLM 훈련 동역학에 영향을 미치는 근본 요인으로서의 내재적 과제 호라이즌 길이를 대체로 간과하며, 종종 다른 복잡성 요인과 혼동한다.
- 더 긴 호라이즌은 오차 누적, 상태-행동 매핑 복잡성의 기하급수적 증가, 희소하고 지연된 피드백으로 인한 모호한 신용 할당 같은 난제를 악화시킨다.
- 추론 복잡성을 일정하게 유지하면서 내재적 과제 호라이즌 길이를 분리하고 변화시키도록 설계된 통제된 과제 환경(스도쿠, 러시아워)을 사용하여 체계적 실증 연구를 수행했다.
- 이 연구는 '호라이즌 축소' 원리, 구체적으로 매크로 액션(에이전트가 한 스텝에 여러 원자적 행동을 생성하도록 허용)과 하위 목표 분해(과제를 검증 가능한 하위 목표로 나누고 조밀한 중간 보상을 부여)를 도입하고 평가한다.
- LLM 에이전트는 지도 미세조정(SFT) 이후, 견고한 학습을 위한 오프폴리시 안정화 기법을 결합하여 재평가된 REINFORCE 알고리즘을 사용한 강화학습(RL)으로 훈련된다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.