Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate
- 발행일
- 출처
- arXiv
- 논문 번호
- 166
- 분야
- Agents / Distillation / Efficiency
- arXiv 번호
- 2604.24881
이 논문은 명시적 멀티 에이전트 추론의 이점을 단일 LLM 안으로 증류하는 2단계 파인튜닝 절차인 Internalized Multi-Agent Debate(IMAD)를 도입한다.
이 논문은 명시적 멀티 에이전트 추론의 이점을 단일 LLM 안으로 증류하는 2단계 파인튜닝 절차인 Internalized Multi-Agent Debate(IMAD)를 도입한다. IMAD 모델은 추론 토큰을 최대 93%까지 줄이면서 동등하거나 향상된 추론 정확도를 달성하며, 에이전트별 표현을 잠재 공간에 국소화함으로써 바람직하지 않은 행동을 표적 제어할 수 있게 한다.
핵심 요약
- 명시적 멀티 에이전트 토론은 LLM 정확도를 높이고 환각을 줄이지만, 여러 차례 모델을 호출하고 장황한 출력을 요구하여 계산 비용이 크고 비싸다.
- LLM 추론을 내재화하는 기존 방법은 주로 단일 에이전트의 명시적 추론 단계에 초점을 맞추며, 멀티 에이전트 토론의 복잡한 상호작용은 다루지 않는다.
- 바람직하지 않은 LLM 행동을 억제하는 것은 거친 제어 메커니즘 때문에 일반적 모델 능력의 저하(정렬세, alignment tax)로 이어지는 경우가 많다.
- 전체 멀티 에이전트 토론 궤적에 대한 지도 파인튜닝(SFT)에 이어 동적 보상을 사용하는 강화학습(RL)으로 구성된 2단계 파인튜닝 파이프라인 IMAD를 개발했다.
- RL 단계는 점진적으로 명시적 토론 언어화에 대한 유인을 줄이는 동시에 출력 길이 한도를 좁혀 가며 정답에 보상하는 동적 보상 함수를 사용하여, 잠재적 내재화를 강제한다.
- 내재화된 모델 내에서 식별된 에이전트 부분공간에 활성화 스티어링을 적용하여, 악의적 특성 억제를 포함한 특정 행동을 제어한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.