VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
- 발행일
- 출처
- arXiv
- 논문 번호
- 777
- 분야
- Computer Vision
- arXiv 번호
- 2607.27380
실행 가능한 Blender 코드를 사고 과정으로 사용해서 물리적으로 일관된 비디오를 생성하는 프레임워크.
이 논문은 한마디로 비디오 생성시 코드 에이전트가 Blender(3D 시뮬레이터) 프로그램을 작성하고 실행해서 물리적으로 정확한 초안 비디오를 만든 뒤, 비디오 편집 모델이 이를 사실적으로 렌더링하게 했다는 이야기다. 텍스트만으로 물리 과정을 추론하는 대신, 실행 가능한 코드로 장면과 시간 진화를 명시한다. PhyGenBench에서 0.475→0.558, VBench-2.0에서 52.18→77.88로 큰 향상을 보였다.
핵심 요약
- 실행 가능한 코드(Blender)를 '과정 수준의 사고 과정'으로 사용하여 물리적 일관성을 확보했다.
- 코드 에이전트가 장면을 프로그래밍하고 시뮬레이터로 초안 비디오를 렌더링한 뒤, 비디오 편집기가 사실적으로 합성한다.
- VideoCoCo-3K 데이터셋(초안-지시-타겟 쌍)을 구축하여 편집기 적응 학습에 활용했다.
- PhyGenBench 0.475→0.558(최고), VBench-2.0 52.18%→77.88%(최고)로 물리 일관성 대폭 향상.
- 튜닝 없이도 초안만으로 0.475→0.506 향상, LoRA 튜닝으로 0.558까지 올라간다. 단계별 기여가 분리됨.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.