Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

발행일
출처
arXiv
논문 번호
439
분야
Robotics
arXiv 번호
2606.17846

Qwen-VL 기반 VLA 파운데이션 모델로, 표현/모션/행동 3차원 정렬을 통해 38,100시간 다출처 로봇 데이터를 일관되게 학습하는 Qwen-RobotManip을 발표한다.

Qwen-RobotManip은 로봇 매니퓰레이션에서 진정한 일반화를 달성하기 위해 정렬(alignment) 우선, 스케일 나중 원칙을 채택한다. 표현 정렬(canonical state-action), 모션 정렬(camera-frame delta pose), 행동 정렬(in-context policy adaptation)의 3축 프레임워크로 이기종 로봇 데이터를 일관되게 통합한다. 인간-대-로봇 합성 파이프라인으로 15개 플랫폼에 걸쳐 에고센트릭 손 동작을 로봇 궤적으로 변환하고, 약 38,100시간의 사전학습 코퍼스를 구축했다. OOD 평가에서 π0.5 등 기존 SOTA를 모든 축에서 능가하며 RoboChallenge 1위(20% 상대 향상)를 달성했다.

핵심 요약

  • 표현(canonical state)·모션(camera-frame delta pose)·행동(in-context adaptation) 3차원 정렬 프레임워크 제안
  • 인간 에고센트릭 영상을 15개 로봇 플랫폼 궤적으로 변환하는 human-to-robot synthesis pipeline
  • 오픈소스 데이터만으로 ~38,100시간 매니퓰레이션 사전학습 코퍼스 구축—독점 데이터 수집 없음
  • OOD 평가(LIBERO-Plus, RoboCasa365, EBench 등)에서 π0.5, GR00T-N1.7을 모든 축에서 능가
  • RoboChallenge Table30-v1 generalist 트랙 1위, 20% 상대적 향상 달성
  • AgileX ALOHA, Franka, UR, ARX 등 4개 실제 로봇 플랫폼에서 검증 완료

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)