SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution
- 발행일
- 출처
- arXiv
- 논문 번호
- 955
- 분야
- Software Engineering
- arXiv 번호
- 2608.18933
코드 저장소 자체에서 합성 이슈를 만들어 실제 이슈가 오기 전에 미리 '프로젝트 특화 지식'을 스킬로 증류해두는, 콜드스타트를 없애는 자기증류 에이전트 프레임워크다.
이 논문은 한마디로 '특정 소프트웨어 프로젝트의 버그를 고치는 에이전트가 프로젝트에만 통하는 지식이 없어서 헤매는 문제'를, 실제 이슈가 도착하기 전에 미리 지식을 만들어두는 방식으로 푼 연구다. SkillForge는 저장소에서 테스트로 검증된 핵심 기능을 찾아 실행 흔적을 따라가고, 이를 재작성해 '가짜 버그'(실행 가능하고 테스트로 검증되는 합성 이슈)를 만든다. 에이전트가 이 합성 이슈를 풀면서 생긴 궤적에서 프로젝트 특화 지식을 스킬로 증류해, 전역 진단 스킬(모듈 역할, 관련 API, 추론 플레이북)과 국소 개입 스킬(엔티티별 수정 가이드, 실패 교훈)의 2층 저장소로 쌓는다. SWE-bench Verified에서 DeepSeek-V3.2 기준 72.2% Pass@1로 기본 에이전트 대비 +5.8%p, SWE-bench Pro에서도 +5.8/+4.1%p 올랐고, 역사 기반·온라인 탐색 기반 기준을 모두 이겼다.
핵심 요약
- 과거 이슈 의존(역사가 있어야 함)이나 이슈당 비싼 테스트타임 탐색 없이, 저장소 자체에서 합성 이슈를 만들어 미리 지식을 축적하는 능동적 접근이다.
- 합성 이슈는 테스트 커버리지가 담보하는 '실제로 실행되는 버그'라서 학습 신호가 행동으로 검증된다.
- 증류된 지식을 전역 진단 스킬과 국소 개입 스킬의 2층 저장소로 구성하고, 이슈 해결 때 전역 초기화와 즉시 주입(JIT)으로 활용한다.
- SWE-bench Verified에서 72.2%(DeepSeek-V3.2, +5.8%p)와 60.6%(GPT-5-mini, +5.6%p) Pass@1. SWE-bench Pro에서도 +5.8/+4.1%p 개선.
- 합성 이슈의 유형 분포가 실제 평가 이슈 분포와 겹치지 않는다. 즉 평가셋 재탕이 아니라 모델이 저지르는 새로운 취약점을 노린다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.