CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 471
- 분야
- AI / General
- arXiv 번호
- 2606.22883
구조화된 능력 분류법과 증거 기반 심층 연구로 고품질 터미널 에이전트 훈련 데이터를 합성하는 파이프라인을 제안한다.
CLI-Universe는 터미널 에이전트 훈련용 태스크를 체계적으로 합성하는 엔진으로, 다차원 능력 분류법(domain/skill/capability/engineering pillar)에서 후보를 생성하고 실제 기술 자료에 대한 심층 연구로 구체화한다. Docker 환경에서 rubric-gated 테스트, hint-conditional 필터링, fail-to-pass 검증을 거쳐 약 2/3를 걸러낸다. 6K 궤적만으로 Qwen3-32B를 파인튜닝하여 Terminal-Bench 2.0에서 33.4%를 달성, 동급 최고 성능을 기록했다.
핵심 요약
- Inside-out 방식: 기존 아티팩트를 재활용하지 않고 구조화된 분류법에서 태스크를 정의 후 증거 기반 연구로 구체화
- 3단계 검증: rubric-gated 테스트, hint-conditional 필터링(자명한 태스크 제거), fail-to-pass 체크
- 전체 후보의 ~2/3를 폐기, 고품질 태스크만 남겨 훈련 신호 밀도 극대화
- CLI-Universe-6K(6,000궤적)로 Qwen3-32B 학습 시 TB 2.0 33.4% → 오픈소스 ≤32B 최고
- BFCL v4 +11.3, VitaBench +11.6 포인트 향상으로 교차 벤치마크 일반화 확인
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.