Recursive Synthesis for Long-Horizon Terminal Tasks
- 발행일
- 출처
- arXiv
- 논문 번호
- 835
- 분야
- AI / General
- arXiv 번호
- 2608.05466
터미널 에이전트용 긴 호라이즌 훈련 데이터를 재귀적 합성으로 대량 생산하는 프레임워크를 제안했다.
이 논문은 한마디로 터미널(명령줄) 에이전트를 훈련시킬 복잡한 과제를 자동으로 대량 생산하는 방법이다. RST는 기존 과제의 해답을 늘리고, 검증기를 다시 맞추고, 샌드박스에서 검증한 뒤 다음 라운드의 씨드로 재사용한다. 15라운드 재귀 합성으로 37,484개의 검증된 과제를 약 0.05달러/개로 만들었고, PPO 훈련으로 Qwen3.5-27B 성능을 Terminal-Bench 2에서 20% 개선했다.
핵심 요약
- 재귀적 합성으로 과제를 점점 어렵게 만들면서도 명령·환경·해답·검증기 일관성을 유지한다.
- 15라운드 만에 37,484개 과제를 생성했고, 합성 수율이 줄지 않아 천장이 없다.
- 중간 해답 길이가 67줄에서 374줄로 5.6배 늘었고, 명령 수도 6배 이상 증가했다.
- 합성 데이터로 SFT·PPO 훈련 시 Terminal-Bench 2/Hard/Long-Horizon에서 최대 10점 개선됐다.
- DeepSeek-V4-Pro pass@4가 90%에서 2.5%로 떨어질 만큼 과제 난이도가 올라간다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.