Lance: Unified Multimodal Modeling by Multi-Task Synergy

발행일
출처
arXiv
논문 번호
196
분야
Computer Vision
arXiv 번호
2605.18678

ByteDance의 Intelligent Creation Lab은 이미지·비디오 이해, 생성, 편집을 단일 프레임워크 안에 통합한 경량 통합 멀티모달 모델 Lance를 개발했다.

Lance는 이미지와 비디오의 이해, 생성, 편집을 한 모델에서 처리하는 가벼운 통합 멀티모달 모델이다. 공유된 교차 멀티모달 시퀀스를 학습하면서도 이해와 생성의 처리 경로는 분리한 이중 스트림 전문가 혼합 구조를 쓴다. 서로 다른 시각 토큰 사이의 간섭을 줄이기 위해 모달리티 인식 회전 위치 인코딩도 도입했다. 학습은 능력별 목표와 데이터 양을 조절하는 단계적 다중 과제 방식으로 진행해 의미 이해와 시각 생성을 함께 강화한다. 실험에서는 강한 멀티모달 이해를 유지하면서 기존 공개 통합 모델보다 이미지와 비디오 생성 성능이 높았으며, 비교 주장은 공개 모델 범위를 기준으로 한다.

핵심 요약

  • 이해를 돕는 생성: 반대로 비디오 편집 같은 생성 작업으로 학습하면 모델이 시간적 동역학과 공간적 관계를 더 깊이 이해하게 되며, 이는 비디오 이해 벤치마크에서의 성능을 향상시킨다.
  • 비디오 생성: VBench 벤치마크에서 Lance는 총점 85.11을 기록해 발표 시점 기준 통합 모델 중 최고였다. 객체 그라운딩과 시간적 일관성에서 강력한 성능을 보였다.
  • 멀티모달 이해: 시간적 인지와 비디오 추론을 평가하는 MVBench에서 Lance는 62.0점을 기록했다. 이는 차순위 통합 모델인 Show-o2(7B) 대비 11.3% 향상된 수치다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)