Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
- 발행일
- 출처
- arXiv
- 논문 번호
- 581
- 분야
- Computer Vision
- arXiv 번호
- 2607.07675
Embodied intelligence 맞춤형 MoE 비디오 기반 모델. 희소 전문가 구조로 용량과 효율을 동시에 확보하고, 로봇 데이터 증강 + 다차원 보상으로 물리적 합리성을 강제했다.
LingBot-Video는 DiT 기반 Mixture-of-Experts(MoE) 비디오 사전학습 패러다임으로, embodied intelligence에 특화한 최초의 대규모 오픈소스 MoE 비디오 기반 모델이다. 인터넷 비디오와 로봇 조작·네비게이션·egocentric 데이터를 통합하는 데이터 프로파일링 엔진을 구축하고, 물리적 합리성과 과제 완수를 반영한 다차원 보상 시스템으로 학습 정렬을 수행한다. 희소 전문가 구조를 통해 모델링 용량과 추론 효율의 균형을 달성하며, 단일 스트림 Diffusion Transformer에 3D MM-RoPE를 적용해 T2I/T2V/I2V를 통합 처리한다.
핵심 요약
- MoE(희소 전문가) 구조 도입으로 dense 대비 추론 효율과 모델링 용량의 트레이드오프 개선
- 데이터 프로파일링 엔진: 인터넷 비디오 + 로봇 조작/네비게이션/egocentric 데이터를 통합 분석·필터링·리밸런싱
- 다차원 보상 시스템: 미적 품질을 넘어 물리적 합리성(physical rationality)과 과제 완수(task completion) 신호를 정렬에 반영
- 단일 스트림 Diffusion Transformer + Multi-Modal 3D RoPE로 T2I/T2V/I2V를 하나의 프레임워크에서 통합
- QK-Norm과 AdaLN-Single 변조로 심층 트랜스포머 안정성 확보, cascaded refiner로 품질 향상
- embodied intelligence 분야 최초的大規模 오픈소스 MoE 비디오 기반 모델로, 코드와 체크포인트 공개
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.