Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction
- 발행일
- 출처
- arXiv
- 논문 번호
- 357
- 분야
- Computer Vision
- arXiv 번호
- 2606.05769
비디오 미래 예측에서 텍스트 대신 연속 잠재 비주얼 토큰으로 중간 추론을 수행하는 FUTURE-L1 프레임워크로, FutureBench에서 61.0→85.4로 대폭 향상시켰다.
기존 비디오 MLLM은 중간 추론을 텍스트로 verbalization하여 미세한 모션·기하학·상호작용 단서를 잃는다. FUTURE-L1은 autoregressive 디코딩 중 언어 토큰과 연속 잠재 비주얼 토큰을 번갈아 생성하는 interleaved latent visual reasoning을 제안한다. SFT 단계에서는 visual-gain 데이터 큐레이션으로 구성한 FUTURE-L1-50K로 잠재 상태를 미래 프레임 임베딩에 정렬하고, RL 단계에서는 LA-DAPO로 outcome-contrastive·temporal-diversity 보상으로 잠재 궤적을 최적화한다. FutureBench에서 Qwen3-VL-8B를 61.0에서 85.4로 향상시키고, TwiFF-Bench에서도 2.44→3.04를 달성했다.
핵심 요약
- 언어 토큰과 연속 latent visual 토큰을 교차 생성하는 interleaved latent visual reasoning 구조 제안
- visual-gain 데이터 큐레이션으로 미래 시각 힌트가 예측에 실제로 도움이 되는 50K 고품질 학습 데이터 구축
- LA-DAPO: 잠재 인식 RL 목표함수로 outcome-contrastive 보상과 temporal-diversity 보상을 결합
- FutureBench에서 Qwen3-VL-8B 61.0→85.4, 기존 최고 Video-CoE 대비 +10.4 포인트
- TwiFF-Bench 평균 2.44→3.04, 추론 깊이가 깊어질수록 latent span 사용량이 적응적으로 증가
- 동일 데이터로 text-only SFT는 65.0에 그친 반면 interleaved latent SFT는 73.2로, 향상이 추가 지도에서 비롯된 것이 아님을 실증
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.