JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
- 발행일
- 출처
- arXiv
- 논문 번호
- 1023
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.25593
에이전트의 '운영체제(하네스)'를 태스크마다 즉석에서 코드로 생성해주는 전용 모델. 가벼운 백본도 강한 하네스를 얹으면 GPT-5.6을 이긴다.
이 논문은 한마디로 '에이전트 성능은 모델만이 아니라 하네스(메모리·계획·행동·도구 프레임워크)가 결정한다'며, 그 하네스를 태스크에 맞춰 즉석 생성하는 모델을 만들었다. 하네스를 메모리·계획·행동·역량 4개 모듈의 실행 가능한 코드로 정의하고, 생성·실패 복구·성과 피드백 진화의 3단계로 훈련했다. DeepSeek-V4-Flash에 얹으니 딥서치·계획 벤치마크에서 GPT-5.6을 앞질렀고, 이미 강한 GLM-5.2는 최대 +20.2점 올랐다. 생성된 하네스는 OpenCode·Claude Code 같은 성숙한 런타임과 대등한 성능을 냈다.
핵심 요약
- 에이전트 능력을 모델과 하네스의 결합 결과로 보고, 미리 고정한 하네스 대신 과제마다 즉석 생성하는 JIT 방식을 제안했다.
- 하네스를 메모리·계획·행동·역량의 네 모듈로 나눈 실행 가능한 코드로 표현해 생성과 수리, 진화가 가능하게 했다.
- 과제 맞춤 학습과 실패 복구 학습, 성과가 더 좋은 하네스를 축적하는 Evo-GDPO를 결합해 생성 모델을 훈련했다.
- DeepSeek-V4-Flash는 두 벤치마크에서 GPT-5.6을 9.1점과 4.3점 앞섰고, GLM-5.2도 과제에 따라 최대 20.2점 향상됐다.
- 전체 실행 틀을 즉석에서 바꾸는 방식은 운영 환경의 안정성과 검증 문제가 남아 있어, 저자들도 안정된 핵심부와 검증 가능한 부분 수정 방식을 후속 과제로 제시했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.