SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

발행일
출처
arXiv
논문 번호
670
분야
LLMs / NLP
arXiv 번호
2607.18213

코딩 에이전트가 도구 출력을 읽을 때 이미 만들어 놓은 내부 표현만으로 어느 줄을 버릴지 판단하게 해서, 별도 채점 모델 없이 토큰을 최대 39% 줄인 연구다.

코딩 에이전트는 cat, grep 같은 도구 출력에 토큰 예산 대부분을 쓰는데, 그 내용의 상당수는 다시 쓰이지 않는다. 기존 방법은 따로 채점 모델을 붙이고 매 턴 목표 힌트 질의를 쓰게 했다. 이 논문은 에이전트 백본이 도구 출력을 읽을 때 만든 마지막 층 은닉 상태 안에 이미 줄 단위 중요도가 들어 있음을 선형 프로브로 보였고(AUC 0.83), 그 위에 가벼운 판별 헤드를 붙인 SWE-Pruner Pro를 제안한다. 길이 인식 임베딩과 샘플별 균형 초점 손실을 더해, 오픈웨이트 백본 2종과 멀티턴 벤치마크 4종에서 최대 39% 토큰을 아끼면서 품질을 유지했고 MiMo-V2-Flash에서는 SWE-Bench Verified 해결률이 3.8퍼센트포인트 올랐다.

핵심 요약

  • 핵심 논지는 가지치기 신호를 밖에서 다시 만들 필요가 없다는 것이다. 도구 출력을 읽는 순간 백본이 이미 그 판단을 표현 안에 담고 있다.
  • 근거로 Qwen3-Coder-Next를 얼린 뒤 줄 단위로 은닉 상태를 평균 낸 로지스틱 회귀 프로브를 돌렸고, 보류 데이터에서 AUC 0.83, 최고 F1 0.63을 얻었다.
  • 방법은 프리필(입력을 한 번에 처리하는 단계)에서 나오는 마지막 층 은닉 상태를 작은 헤드가 읽어 토큰별 점수를 내고 줄 단위 유지 또는 삭제로 모으는 구조다.
  • 설계 요소 두 가지가 성능을 끌어올린다. 출력 줄 수를 넣는 길이 인식 임베딩과, 샘플마다 유지와 삭제 비율을 맞추는 균형 초점 손실이다.
  • 결과는 오픈웨이트 백본 2종과 멀티턴 벤치마크 4종에서 SWE-QA-Pro 39%, Oolong 30% 토큰 절감이며, MiMo-V2-Flash 기준 Oolong 정확도 2.2점, SWE-Bench Verified 해결률 3.8퍼센트포인트 상승을 함께 얻었다.
  • 추가 비용은 제한적이다. 추론 엔진 안에 헤드를 붙인 재생 실험에서 생성 총 시간 대비 15.0%의 벽시계 시간만 더 들었고 별도 모델 호출은 없다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)