LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards
- 발행일
- 출처
- arXiv
- 논문 번호
- 278
- 분야
- LLMs / NLP
- arXiv 번호
- 2605.31584
LongTraceRL은 루브릭 보상을 활용해 검색 에이전트 궤적 기반으로 롱컨텍스트 추론을 학습한다.
롱컨텍스트 추론은 대규모 언어 모델의 핵심 난제로 남아 있으며, 방대한 방해 정보 속에서 핵심 정보를 찾아 통합하는 데 실패하는 경우가 많다. 검증 가능한 보상을 활용한 강화학습(RLVR)은 이 과제에서 가능성을 보여주었으나, 기존 방법들은 혼동성이 낮은 방해 항목과 희소하고 결과만 반영하는 보상 신호에 한정되어 중간 추론 단계를 감독하지 못한다. 이 논문은 이러한 문제를 해결하기 위해 LongTraceRL을 제안한다. 데이터 구성 측면에서, 지식 그래프 랜덤 워크를 통해 멀티홉 질문을 생성하고 검색 에이전트 궤적을 활용해 계층화된 방해 항목을 구축한다. 즉, 에이전트가 읽었으나 인용하지 않은 문서(높은 혼동성)와 검색 결과에는 등장했으나 한 번도 열어보지 않은 문서(낮은 혼동성)를 만들어, 무작위 샘플링이나 단일 검색으로 구축한 것보다 훨씬 까다로운 학습 컨텍스트를 생성한다. 보상 설계 측면에서, 각 추론 사슬을 따라 등장하는 정답 엔티티를 세밀한 엔티티 수준의 과정 감독으로 사용하는 루브릭 보상을 제안한다. 이 루브릭 보상은 최종 답이 정확한 응답에만 적용되며(긍정 전용 전략), 정답 응답들 사이의 추론 품질을 구별하고 보상 해킹을 방지한다. 다섯 개의 롱컨텍스트 벤치마크에서 세 가지 추론 LLM(4B~30B)으로 수행한 실험은 LongTraceRL이 강력한 베이스라인을 일관되게 능가하며 포괄적이고 근거에 기반한 추론을 유도함을 보여준다. 코드, 데이터셋, 모델은 https://github.com/THU-KEG/LongTraceRL 에서 제공된다.
핵심 요약
- 다섯 개의 롱컨텍스트 벤치마크에서 세 가지 추론 LLM(4B~30B)으로 수행한 실험은 LongTraceRL이 강력한 베이스라인을 일관되게 능가하며 포괄적이고 근거에 기반한 추론을 유도함을 보여준다.
- 검증 가능한 보상을 활용한 강화학습(RLVR)은 이 과제에서 가능성을 보여주었으나, 기존 방법들은 혼동성이 낮은 방해 항목과 희소하고 결과만 반영하는 보상 신호에 한정되어 중간 추론 단계를 감독하지 못한다.
- 이 논문은 이러한 문제를 해결하기 위해 LongTraceRL을 제안한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.