Tunable Tool-Call Rates in LLM Agents via Representation Steering

발행일
출처
arXiv
논문 번호
1036
분야
AI / General
arXiv 번호
2608.25198

LLM이 도구를 호출할지 말지를 모델 내부 표현에 선형 방향 벡터 하나를 더해 실시간으로 조절하는 기법. 학습·프롬프트 변경 없이 QA 정확도를 거의 2배 올렸다.

이 논문은 한마디로 도구를 쓸지 말지 결정을 모델 잔차 스트림(내부 표현 공간)의 단일 선형 방향으로 조종할 수 있음을 보인 연구다. 저자들은 도구 호출 선호 신호에서 평균차 방향을 뽑아내고, 추론 시 이 방향을 세기 α로 더하면 호출률이 0% 근처에서 90% 넘게까지 단조적으로 움직인다. 방향을 올리면 모델이 스스로 못 답하는 질문에 정확히 검색을 부르고, 내리면 불필요한 계산기 호출을 없앤다. 실제 도구 실행 환경에서 비용-정확도 파레토 프론티어를 그리며 오픈도메인 QA 정확도를 0.29에서 0.56으로 거의 두 배 올렸고, dense·MoE·멀티모달 모델 전반으로 전이됐다.

핵심 요약

  • 도구 호출 여부를 결정하는 선형 방향을 학습 없이 모델 자체 신호에서 뽑아냈다.
  • 방향 강도를 조절하면 호출률이 0% 근처에서 90% 이상까지 단조적으로 움직인다(호출 형식은 그대로 정상).
  • 방향을 올리면 모델이 스스로 못 답하는 질문에 정확히 도구를 부르고, 내리면 불필요한 호출을 줄인다.
  • 안 본 도구에도 전이되고, 어느 도구를 고르는지(선택)와 호출할지(결정)가 서로 다른 방향으로 분리돼 있다.
  • 실 실행 환경에서 QA 정확도를 0.29에서 0.56으로 올렸고 dense·MoE·멀티모달 모델까지 같은 레시피가 통했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)