FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry
- 발행일
- 출처
- arXiv
- 논문 번호
- 675
- 분야
- Computer Vision
- arXiv 번호
- 2607.18227
이미지 편집 데이터만으로 영상 편집을 배우게 만드는 픽셀쌍 시간 왜곡 흐름장을 제안한 논문이다.
영상 편집 학습 데이터는 마스크 라벨링, I2V 모델 합성, VLM 필터링 같은 손이 많이 가는 공정에 의존해서 작업 종류가 잘 안 늘어난다. 저자들은 영상 편집의 본질이 "첫 프레임에서 정해진 픽셀 단위 편집 대응을 시간축으로 유지하는 것"이라고 보고, 이미지 편집 쌍에서 실시간으로 영상 편집 샘플을 만들어내는 픽셀쌍 4D 시간 왜곡 흐름장을 만들었다. 또 이미지를 한 프레임짜리 영상으로 보고, 두 양식의 출력 분포를 서로 흉내내게 하는 modality mimic 생성 손실과 편집 손실을 설계했다. 여기에 지시문이 가리키는 영역만 고치도록 참조 표현 분할 같은 감각 과제와 잠재공간, 어텐션 수준 손실을 붙여 마스크 없이 편집 영역을 스스로 찾게 했다.
핵심 요약
- 영상 편집 학습에 현실적으로 자연스러운 영상 쌍은 필요 없고, 첫 프레임의 픽셀 대응이 시간축으로 일관되게 유지되기만 하면 된다는 것이 핵심 주장이다.
- 입력 이미지와 목표 이미지를 각각 3D 격자로 만들고 격자 역샘플링으로 픽셀쌍 4D 시간 왜곡 흐름장을 구성해, 이미지 편집 샘플에서 영상 편집 샘플을 실시간으로 생성한다.
- 이미지를 한 프레임 영상으로 보고, T2I가 T2V의 사실감을 흉내내고 V2V 편집이 더 빨리 수렴하는 I2I 편집을 흉내내도록 두 가지 modality mimic 손실을 둔다.
- 참조 표현 분할 등 감각 관련 과제와 편집영역 인식 잠재 손실, 어텐션 손실을 넣어 별도 MLLM이나 추론용 마스크 입력 없이 편집 영역을 모델이 스스로 찾게 했다.
- Wan2.1-T2V-1.3B 위에 후속 학습을 했고, 학습률을 5e-6에서 1e-5로 워밍업하면 수천 스텝 만에 영상 편집 반응이 나타났다.
- 특별히 만든 영상 편집 데이터를 하나도 쓰지 않고도 다양한 편집 과제가 되고, 언어로 지목한 객체를 영상에서 분할하고 추적하는 SAM3 같은 능력까지 나타났다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.