SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution

발행일
출처
arXiv
논문 번호
955
분야
Software Engineering
arXiv 번호
2608.18933

코드 저장소 자체에서 합성 이슈를 만들어 실제 이슈가 오기 전에 미리 '프로젝트 특화 지식'을 스킬로 증류해두는, 콜드스타트를 없애는 자기증류 에이전트 프레임워크다.

이 논문은 한마디로 '특정 소프트웨어 프로젝트의 버그를 고치는 에이전트가 프로젝트에만 통하는 지식이 없어서 헤매는 문제'를, 실제 이슈가 도착하기 전에 미리 지식을 만들어두는 방식으로 푼 연구다. SkillForge는 저장소에서 테스트로 검증된 핵심 기능을 찾아 실행 흔적을 따라가고, 이를 재작성해 '가짜 버그'(실행 가능하고 테스트로 검증되는 합성 이슈)를 만든다. 에이전트가 이 합성 이슈를 풀면서 생긴 궤적에서 프로젝트 특화 지식을 스킬로 증류해, 전역 진단 스킬(모듈 역할, 관련 API, 추론 플레이북)과 국소 개입 스킬(엔티티별 수정 가이드, 실패 교훈)의 2층 저장소로 쌓는다. SWE-bench Verified에서 DeepSeek-V3.2 기준 72.2% Pass@1로 기본 에이전트 대비 +5.8%p, SWE-bench Pro에서도 +5.8/+4.1%p 올랐고, 역사 기반·온라인 탐색 기반 기준을 모두 이겼다.

핵심 요약

  • 과거 이슈 의존(역사가 있어야 함)이나 이슈당 비싼 테스트타임 탐색 없이, 저장소 자체에서 합성 이슈를 만들어 미리 지식을 축적하는 능동적 접근이다.
  • 합성 이슈는 테스트 커버리지가 담보하는 '실제로 실행되는 버그'라서 학습 신호가 행동으로 검증된다.
  • 증류된 지식을 전역 진단 스킬과 국소 개입 스킬의 2층 저장소로 구성하고, 이슈 해결 때 전역 초기화와 즉시 주입(JIT)으로 활용한다.
  • SWE-bench Verified에서 72.2%(DeepSeek-V3.2, +5.8%p)와 60.6%(GPT-5-mini, +5.6%p) Pass@1. SWE-bench Pro에서도 +5.8/+4.1%p 개선.
  • 합성 이슈의 유형 분포가 실제 평가 이슈 분포와 겹치지 않는다. 즉 평가셋 재탕이 아니라 모델이 저지르는 새로운 취약점을 노린다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)