InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 398
- 분야
- Computer Vision
- arXiv 번호
- 2606.12195
멀티모달 컨텍스트 추론(MCR) 프레임워크로 비디오 이해를 에이전트화한 InternVideo3. 폐루프 추론과 KV-cache 압축(M2LA)으로 장시간 비디오 태스크에서 강력한 성능 달성.
InternVideo3는 멀티모달 이해를 관측-추론-행동-피드백-갱신의 폐루프 과정으로 정형화한 Multimodal Contextual Reasoning(MCR)을 제안한다. M2LA attention으로 KV-cache를 압축하면서 전체 멀티모달 토큰 스트림을 보존하여 장시간 롤아웃을 효율화한다. 단계적 훈련(지속 사전학습, short-to-long SFT, RL, 온정책 증류)을 통해 Video-MME, MLVU, EgoSchema 등 장시간 비디오 벤치마크에서 InternVideo2.5 대비 큰 향상을 달성했다.
핵심 요약
- MCR: 관측, 추론, 도구 행동, 피드백, 메모리를 공유 진화 컨텍스트로 통합하는 폐루프 멀티모달 추론 정식화
- M2LA(Multimodal Multi-head Latent Attention): KV-cache 압축으로 긴 멀티모달 롤아웃을 효율화
- 단계적 훈련: M2LA 변환 후 지속 사전학습, short-to-long 비디오 SFT, 검증 가능 태스크 RL, 온정책 증류
- Video-MME, MLVU, EgoSchema 등 장시간 비디오 벤치마크에서 InternVideo2.5-7B 대비 실질적 향상
- 검색 및 검증 도구를 갖춘 비디오 에이전트로 인스턴스화하여 재귀적 멀티모달 추론의 실용성 입증
- 오픈 웨이트 생태계가 빠르게 발전 중이므로 최첨단 성능 주장보다는 맥락 효율성과 폐루프 추론의 원칙적 가치 강조
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.