PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 1142
- 분야
- AI / Agents
- arXiv 번호
- 2609.40285
이 논문은 멀티턴 에이전트가 실패하는 결정적 실수(피벗탈 미스테이크)를 찾아서 '실수 예방'과 '실수 후 회복'을 함께 가르치는 학습법을 제안했다.
이 논문은 한마디로 에이전트가 여러 턴에 걸쳐 일할 때 실패를 부르는 '결정적 실수'를 잡아서, 그 실수를 안 저지르게 하고 저질렀을 땐 빠르게 회복하게 훈련시키는 방법이다. 저자들은 Qwen3 모델 3종(8B~235B)에서 실패한 롤아웃의 절반 이상에 결정적 실수가 들어 있고, 대부분 초반에 발생하지만 몇 턴만 잘 인도하면 복구 가능하다는 걸 발견했다. 이에 교사 모델이 결정적 실수 지점에 정답 행동과 회복 행동을 알려주는 'PivotOPD'를 제안했다. 13개 기준 방법과 비교해 ALFWorld/WebShop/검색 QA 평균 성능이 가장 높았고, SWE-Bench Verified에서도 +3.2% 해결률 상승이 다른 모델 계열로 이전됐다.
핵심 요약
- 실패한 에이전트 궤적의 절반 이상에 '결정적 실수'가 있고, 대부분 초반 턴에 나온다는 걸 Qwen3 3종으로 확인했다.
- 그 실수는 치명적이지만 회복 가능해서, 실수 직후 몇 턴만 인도하면 과제 성공으로 되돌아올 수 있었다.
- 교사 모델이 정답 행동(예방용)과 회복 행동(복구용)을 제공하고, 두 가지 증류를 함께 쓰는 PivotOPD를 제안했다.
- 13개 기준 대비 ALFWorld에서 +5.5%, SWE-Bench Verified에서 +3.2% 향상으로 다른 모델 계열에도 이전됐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.