OmniReasoner: Thinking with Long Audio-Video via Native Tool Use
- 발행일
- 출처
- arXiv
- 논문 번호
- 686
- 분야
- Computer Vision
- arXiv 번호
- 2607.19339
긴 오디오-비디오에서 필요한 구간만 확대해서 살펴보는 도구 사용 행위를 모델에게 학습시킨 프레임워크.
이 논문은 한마디로 긴 오디오-비디오를 볼 때 필요한 순간만 확대(zoom-in)해서 다시 살펴보는 도구 사용 능력을 모델에게 가르친 연구다. 모델은 먼저 전체를 낮은 해상도로 둘러본 뒤, 답에 필요한 구간이 보이면 확대 도구를 호출해서 해당 구간을 고해상도로 다시 본다. 핵심 기술인 TimeAnchor는 서로 다른 샘플링 해상도 사이에서도 시간 좌표가 정확히 유지되게 한다. SFT와 RL로 학습시켰으며, 여러 벤치마크에서 정답률과 시간 지역화가 모두 향상됐다.
핵심 요약
- 긴 오디오-비디오에서 확대 도구를 적응적으로 호출하는 도구 사용 학습 프레임워크를 제안했다.
- TimeAnchor로 서로 다른 샘플링 해상도 간 시간 좌표 일관성을 유지한다.
- Temporal Augmented Data Engine으로 수동 없이도 학습 데이터를 자동 생성했다.
- OmniVideoBench 29.3→34.8, LVOmniBench 32.0→35.4로 정확도가 향상됐다.
- 영상이 길어질수록 확대 도구 호출 빈도가 올라가며, 실제로 정확도 향상에 기여함을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.