InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

발행일
출처
arXiv
논문 번호
398
분야
Computer Vision
arXiv 번호
2606.12195

멀티모달 컨텍스트 추론(MCR) 프레임워크로 비디오 이해를 에이전트화한 InternVideo3. 폐루프 추론과 KV-cache 압축(M2LA)으로 장시간 비디오 태스크에서 강력한 성능 달성.

InternVideo3는 멀티모달 이해를 관측-추론-행동-피드백-갱신의 폐루프 과정으로 정형화한 Multimodal Contextual Reasoning(MCR)을 제안한다. M2LA attention으로 KV-cache를 압축하면서 전체 멀티모달 토큰 스트림을 보존하여 장시간 롤아웃을 효율화한다. 단계적 훈련(지속 사전학습, short-to-long SFT, RL, 온정책 증류)을 통해 Video-MME, MLVU, EgoSchema 등 장시간 비디오 벤치마크에서 InternVideo2.5 대비 큰 향상을 달성했다.

핵심 요약

  • MCR: 관측, 추론, 도구 행동, 피드백, 메모리를 공유 진화 컨텍스트로 통합하는 폐루프 멀티모달 추론 정식화
  • M2LA(Multimodal Multi-head Latent Attention): KV-cache 압축으로 긴 멀티모달 롤아웃을 효율화
  • 단계적 훈련: M2LA 변환 후 지속 사전학습, short-to-long 비디오 SFT, 검증 가능 태스크 RL, 온정책 증류
  • Video-MME, MLVU, EgoSchema 등 장시간 비디오 벤치마크에서 InternVideo2.5-7B 대비 실질적 향상
  • 검색 및 검증 도구를 갖춘 비디오 에이전트로 인스턴스화하여 재귀적 멀티모달 추론의 실용성 입증
  • 오픈 웨이트 생태계가 빠르게 발전 중이므로 최첨단 성능 주장보다는 맥락 효율성과 폐루프 추론의 원칙적 가치 강조

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)