Toward Native Multimodal Modeling: A Roadmap

발행일
출처
arXiv
논문 번호
233
분야
Computer Vision
arXiv 번호
2605.25343

텐센트 Youtu Lab 주도로 네이티브 멀티모달 모델링(NMM)의 발전 경로를 체계화한 로드맵으로, T2M·M2T·M2M 대칭 모델링 등 3축 분류와 데이터·평가 전략을 망라한다.

본 논문은 네이티브 멀티모달 모델링(NMM) 분야의 기술 동향을 T2M(텍스트→멀티모달 생성), M2T(멀티모달→텍스트 이해), M2M(대칭 멀티모달) 3축으로 분류하는 구조화 로드맵이다. 각 축 내에서 완전 이산화 통합 모델과 모달리티 특성 보존 모델의 두 설계 철학을 비교하며, token 압축·물리 일관성·오디오-비주얼 정렬 등 핵심 과제를 분석한다. 또한 고품질 데이터 구축 전략과 평가 방법론을 망라하여 향후 NMM 연구 방향을 제시한다.

핵심 요약

  • NMM 모델을 T2M(생성), M2T(이해), M2M(대칭) 3축으로 체계적 분류
  • 완전 이산화 통합(digital token) vs 모달리티 특성 보존(연속 특징 공간) 설계 철학 비교
  • Token explosion 해결을 위한 극단적 VAE 압축·동적 sparse attention pruning 기술 동향 정리
  • 비디오 생성에서 물리 법칙 이해(강체 역학·중력·충돌)를 위한 explicit rule vs implicit emergence 접근 분석
  • 오디오-비주얼 정밀 동기화를 위한 unified timeline anchoring과 deep architectural coupling 방안 제시
  • Comprehension-Generation 딜레마 해소를 위한 physical decoupling·encoder-free modeling 등 데이터 및 평가 전략 수록

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)