Visual prompt engineering for video models
- 발행일
- 출처
- arXiv
- 논문 번호
- 755
- 분야
- Computer Vision
- arXiv 번호
- 2607.25537
이 논문은 비디오 모델에게 '시각적 프롬프트 엔지니어링'(입력 이미지를 더 현실적으로 변환)을 하면 추론 성능이 크게 올라간다는 것을 발견한 Google DeepMind의 연구다.
이 논문은 한마디로 비디오 모델의 입력 이미지를 더 사실적으로 바꾸면 추론 성능이 크게 올라간다는 것을 보여준다. 텍스트 프롬프트 엔지니어링이 LLM에 효과적이듯, 시각 프롬프트 엔지니어링(VIPE)이 비디오 모델에 효과적이다. 스케치를 사진처럼 바꾸니 Wan2.2, Veo 3.1, Omni Flash 모두 크게 향상되었다. 특히 텍스트 프롬프트 최적화나 self-consistency보다 더 효과적일 때가 많았다. 핵심 발견은 비디오 모델이 '현실주의 편향(realism bias)'을 가진다는 것 — 사실적인 장면에서 훨씬 더 잘 추론한다.
핵심 요약
- 비디오 모델에 대한 시각적 프롬프트 엔지니어링(VIPE)을 체계적으로 제안하고 검증했다.
- Veo 3.1이 스케치→사실적 변환 후 물리 추론 정확도가 41.3%→59.3%로 18%p 급증했다.
- 현실주의 편향 발견: 비디오 모델은 사실적 장면에서 훨씬 더 잘 추론한다. 추상적 벤치마크는 모델 능력을 과소평가한다.
- VIPE가 텍스트 프롬프트 최적화나 self-consistency 같은 test-time scaling보다 더 효과적인 경우가 많다.
- 단계적 실험에서 현실성이 한 단계씩 올라갈 때마다 장면 일관성이 함께 개선되는 것을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.