Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

발행일
출처
arXiv
논문 번호
166
분야
Agents / Distillation / Efficiency
arXiv 번호
2604.24881

이 논문은 명시적 멀티 에이전트 추론의 이점을 단일 LLM 안으로 증류하는 2단계 파인튜닝 절차인 Internalized Multi-Agent Debate(IMAD)를 도입한다.

이 논문은 명시적 멀티 에이전트 추론의 이점을 단일 LLM 안으로 증류하는 2단계 파인튜닝 절차인 Internalized Multi-Agent Debate(IMAD)를 도입한다. IMAD 모델은 추론 토큰을 최대 93%까지 줄이면서 동등하거나 향상된 추론 정확도를 달성하며, 에이전트별 표현을 잠재 공간에 국소화함으로써 바람직하지 않은 행동을 표적 제어할 수 있게 한다.

핵심 요약

  • 명시적 멀티 에이전트 토론은 LLM 정확도를 높이고 환각을 줄이지만, 여러 차례 모델을 호출하고 장황한 출력을 요구하여 계산 비용이 크고 비싸다.
  • LLM 추론을 내재화하는 기존 방법은 주로 단일 에이전트의 명시적 추론 단계에 초점을 맞추며, 멀티 에이전트 토론의 복잡한 상호작용은 다루지 않는다.
  • 바람직하지 않은 LLM 행동을 억제하는 것은 거친 제어 메커니즘 때문에 일반적 모델 능력의 저하(정렬세, alignment tax)로 이어지는 경우가 많다.
  • 전체 멀티 에이전트 토론 궤적에 대한 지도 파인튜닝(SFT)에 이어 동적 보상을 사용하는 강화학습(RL)으로 구성된 2단계 파인튜닝 파이프라인 IMAD를 개발했다.
  • RL 단계는 점진적으로 명시적 토론 언어화에 대한 유인을 줄이는 동시에 출력 길이 한도를 좁혀 가며 정답에 보상하는 동적 보상 함수를 사용하여, 잠재적 내재화를 강제한다.
  • 내재화된 모델 내에서 식별된 에이전트 부분공간에 활성화 스티어링을 적용하여, 악의적 특성 억제를 포함한 특정 행동을 제어한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)