Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

발행일
출처
arXiv
논문 번호
1068
분야
AI / General
arXiv 번호
2609.04148

에이전트가 작업하며 남긴 기록(트라젝토리)의 파일 조작을 되감아 '실행 가능한 환경' 37.3k개를 복원하고, 그 위에서 과제를 합성해 Qwen3.5-27B를 Terminal-Bench 2.1 +11.9점 끌어올린 논문이다.

이 논문은 한마디로 에이전트가 일하며 남긴 작업 기록을 되감아 실행 가능한 작업 환경으로 복원하고, 그 위에서 새 과제를 대량 생산하는 방법이다. 기록 속 파일 읽기/쓰기 이력을 에이전트가 고치기 전 상태로 되돌려 워크스페이스를 복구하고, 부족한 파일은 보완 에이전트가 채운다. 이렇게 37.3k개 환경을 만들고 각 과제마다 검증기를 붙여 통과한 데이터로만 Qwen3.5-27B를 학습시켰다. 결과는 단일 라운드 벤치마크(Terminal-Bench 2.1) +11.9점, 멀티 라운드 벤치마크(MT@4) +13.8점이었고, 기록을 그대로 따라 하는 것보다 복원 환경에서 다시 풀게 하는 게 훨씬 좋았다.

핵심 요약

  • 에이전트 기록 안에 이미 환경 정보가 다 담겨 있다는 발상으로, 파일 조작 되감기 + 보완 에이전트로 37.3k개의 재사용 가능한 실행 환경을 복원했다.
  • 한 환경에서 여러 과제를 뽑아 내되, 여러 코드베이스를 넘나드는 과제(폭 확장)와 사용자 피드백이 이어지는 멀티 라운드 과제(깊이 확장)까지 합성했다.
  • 과제마다 검증기를 붙이고 통과한 데이터만 써서, Qwen3.5-27B가 Terminal-Bench 2.1에서 11.9점, EvoCode-Bench v2 MT@4에서 13.8점 올랐다.
  • 같은 데이터 예산이면 질문이나 해답 수를 늘리는 것보다 환경 수를 늘리는 게 더 효과적이었다(53.2→56.0 vs 53.8/53.9).
  • 원본 기록을 그대로 따라 하는 학습보다 복원 환경에서 과제를 다시 풀게 하는 학습이 훨씬 좋았다.
  • 소프트웨어 엔지니어링(SWE) 기록에서 만든 데이터로도 터미널 벤치마크 평균이 47.0→50.0으로 올라 도메인을 넘어 일반화됐다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)