HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement

발행일
출처
arXiv
논문 번호
671
분야
Computer Vision
arXiv 번호
2607.18217

사람과 사물이 함께 나오는 맞춤형 영상 생성에서, 멀티모달 대형언어모델을 텍스트 인코더를 건드리지 않고 붙이는 방식을 제안한 논문이다.

참조 이미지로 사람과 사물이 상호작용하는 영상을 만드는 작업에서, 기존 방법은 인물 충실도와 상호작용 정확도를 동시에 잡지 못했고 같은 사물의 여러 참조 이미지(다시점, 글자 지도)를 묶어 이해하지 못했다. HOMIE는 텍스트 인코더를 그대로 두고, 멀티모달 대형언어모델의 특징을 영상 토큰과 함께 셀프 어텐션 단계에 넣는 전역 멀티모달 안내(GMG)를 제안한다. 또 토큰이 어느 모달리티에서 왔고 어느 참조에 속하는지 구분하는 모달리티 참조 임베딩(MRE)을 붙여 같은 사물의 참조들을 하나로 묶는다. 결과로 여러 HOCVP 과제에서 최고 성능을 냈고, 특히 로고를 사물에 올바로 붙이는 추론과 글자 정확도에서 앞섰다.

핵심 요약

  • 문제 설정: 참조 이미지가 서로 다른 대상인 경우(inter-subject)와 같은 대상의 여러 장인 경우(intra-subject)를 하나의 틀로 다룬다.
  • 기존 두 방식의 한계를 지적한다. 멀티모달 모델 특징을 텍스트 임베딩 공간에 맞추면 텍스트 인코더의 조종력이 죽고, 텍스트 인코더를 아예 멀티모달 모델로 갈아끼우면 재정렬 비용이 크다.
  • 제안 1 GMG: 멀티모달 모델에서 뽑은 전역 표현을 쿼리와 키 계산 단계에서 영상 토큰에 더해 셀프 어텐션 안으로 지식을 넣는다.
  • 제안 2 MRE: 토큰의 모달리티와 참조 번호를 구분하는 학습 가능한 임베딩으로, 같은 사물의 다시점이나 글자 지도가 별개 물체로 복제되어 나오는 오류를 막는다.
  • 성능: 글자 인식 정확도가 SkyReels-V3 대비 21.8퍼센트 상대 개선, 다시점 지표 DINOrec 0.696으로 비교 대상 중 최고, 사용자 40명 평가에서 전체 품질 선호율 64.7퍼센트.
  • 제거 실험에서 GMG를 빼면 얼굴 유사도가 0.786에서 0.697로, MRE를 빼면 글자 정확도가 0.452에서 0.376으로 떨어진다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)