Beacon: Knowing When and How to Perform Agentic Visual Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 771
- 분야
- Computer Vision
- arXiv 번호
- 2607.28595
비주얼 추론에서 도구를 언제 쓸지, 쓸 때 진짜 도움이 되는지를 학습하는 모델. 기존의 무조건적 도구 사용을 교정한다.
이 논문은 한마디로 멀티모달 AI가 시각적 추론을 할 때 도구(코드 실행 등)를 '적절할 때만' 쓰도록 훈련시켰다는 이야기다. 기존 모델들은 쉬운 문제에서도 도구를 남용하여 오히려 성능이 떨어지는 문제가 있었다. Beacon은 '필요성 인지 보상'과 '힌트 유도 학습'으로 도구 사용 적응성과 효과를 모두 개선했다. 13개 벤치마크에서 최고 평균 성능을 달성했다.
핵심 요약
- 도구 사용의 두 가지 문제를 정의했다: Mode Adaptiveness(언제 도구가 필요한지 아는 것)와 Tool Effect(도구가 진짜 도움이 되는지).
- 기존 모델들은 어려운 문제에서 얻는 이득이 쉬운 문제에서 생기는 오차로 상쇄되어, 도구 사용 효과가 거의 없었다.
- 필요성 인지 적응 보상(NAAR)으로 불필요한 도구 호출은 줄이고, 힌트 유도 학습(HCE)으로 어려운 문제의 도구 사용 능력을 강화했다.
- 13개 벤치마크 평균 58.98%로 최고 성능, 기반 모델 대비 +6.07%p 향상, 도구 이득-해 gap +3.14%p로 최대다.
- 약 40%의 전부 오답 그룹을 힌트 롤아웃으로 회수하여, 학습 신호를 효과적으로 재활용했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.