Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

발행일
출처
arXiv
논문 번호
357
분야
Computer Vision
arXiv 번호
2606.05769

비디오 미래 예측에서 텍스트 대신 연속 잠재 비주얼 토큰으로 중간 추론을 수행하는 FUTURE-L1 프레임워크로, FutureBench에서 61.0→85.4로 대폭 향상시켰다.

기존 비디오 MLLM은 중간 추론을 텍스트로 verbalization하여 미세한 모션·기하학·상호작용 단서를 잃는다. FUTURE-L1은 autoregressive 디코딩 중 언어 토큰과 연속 잠재 비주얼 토큰을 번갈아 생성하는 interleaved latent visual reasoning을 제안한다. SFT 단계에서는 visual-gain 데이터 큐레이션으로 구성한 FUTURE-L1-50K로 잠재 상태를 미래 프레임 임베딩에 정렬하고, RL 단계에서는 LA-DAPO로 outcome-contrastive·temporal-diversity 보상으로 잠재 궤적을 최적화한다. FutureBench에서 Qwen3-VL-8B를 61.0에서 85.4로 향상시키고, TwiFF-Bench에서도 2.44→3.04를 달성했다.

핵심 요약

  • 언어 토큰과 연속 latent visual 토큰을 교차 생성하는 interleaved latent visual reasoning 구조 제안
  • visual-gain 데이터 큐레이션으로 미래 시각 힌트가 예측에 실제로 도움이 되는 50K 고품질 학습 데이터 구축
  • LA-DAPO: 잠재 인식 RL 목표함수로 outcome-contrastive 보상과 temporal-diversity 보상을 결합
  • FutureBench에서 Qwen3-VL-8B 61.0→85.4, 기존 최고 Video-CoE 대비 +10.4 포인트
  • TwiFF-Bench 평균 2.44→3.04, 추론 깊이가 깊어질수록 latent span 사용량이 적응적으로 증가
  • 동일 데이터로 text-only SFT는 65.0에 그친 반면 interleaved latent SFT는 73.2로, 향상이 추가 지도에서 비롯된 것이 아님을 실증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)