Tmax: A simple recipe for terminal agents

발행일
출처
arXiv
논문 번호
478
분야
LLMs / NLP
arXiv 번호
2606.23321

터미널 에이전트 RL 훈련을 위한 오픈 데이터셋(TMAX-15K)과 단순한 RL 레시피로 9B 모델이 TB 2.0 27%를 달성한다.

Tmax는 터미널 에이전트 RL 훈련을 위한 오픈 데이터셋과 레시피를 제공한다. TMAX-15K는 14,600개의 RL 환경 인스턴스로, 기존 최대 터미널 데이터셋 대비 2.5배 이상 크며, 난이도 제어·페르소나·검증자 다양화를 결합한 합성 파이프라인으로 생성했다. DPPO(Divergence PPO)와 outcome-only 보상으로 9B 모델을 학습하여 Terminal-Bench 2.0에서 27%를 달성, 소형 모델로 대형 모델을 능가했다. SWE-Bench Verified 등 태스크 및 다른 하네스로의 일반화도 확인했다.

핵심 요약

  • TMAX-15K: 14,600개 RL 환경 인스턴스, 기존 최대 터미널 데이터셋 대비 2.5배 이상
  • 9B 모델로 Terminal-Bench 2.0 27% 달성 → 30B 미만 오픈 모델 중 최고 수준
  • 난이도 제어 + 페르소나 + 검증자 다양화로 고품질 환경 합성
  • DPPO + FP32 LM head + large group size로 장시호 에이전트 RL 안정화
  • SWE-Bench Verified +5점 등 교차 태스크 및 교차 하네스 일반화 확인(RL이 단순 harness-fitting 아님)

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)