Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

발행일
출처
arXiv
논문 번호
620
분야
Computer Vision
arXiv 번호
2607.12894

Tencent embodied agent 기반 모델, 3B 활성 파라미터 MoE VLM으로 38 벤치마크 최고.

Action-Relevant State Understanding, Action-Transition Reasoning, Sequential and Adaptive Reasoning의 3단계 능력 체계를 정의하고 이에 맞춰 pre-training부터 post-training까지 데이터 파이프라인을 설계했다. Hy3-A3B 언어 백본 + Hy-ViT2 비전 인코더 + MoE 구조로 3B 활성 파라미터만으로 이전 세대 A32B에 근접하는 성능을 보인다. 38개 벤치마크 중 19개에서 동급 최고, Qwen3.6-A3B 대비 평균 4.4% 우위, 전 세대 대비 8.4% 향상을 달성했다. GRPO 2단계 RL과 R2R-CE 내비게이션 SR 57.9%를 기록했다.

핵심 요약

  • 행동 관련 상태 이해, 행동 전이 추론, 순차·적응 추론의 세 단계 능력 분류에 맞춰 사전학습과 후학습 데이터를 구성했다.
  • Hy3-A3B 언어 백본, Hy-ViT2 시각 인코더, 전문가 혼합 구조로 활성 파라미터를 3B로 제한했다.
  • 38개 벤치마크 중 19개에서 비슷한 크기 모델 가운데 가장 높은 성능을 냈고 이전 Hy-Embodied-0.5보다 평균 8.4% 향상됐다.
  • 적은 활성 파라미터로 다중 턴 상호작용과 장기 추론을 지원해 지연에 민감한 물리 세계 에이전트의 기반 모델로 활용할 수 있다.
  • 3B 활성 모델은 이전 세대의 32B 활성 모델에 가까운 수준일 뿐 모든 평가에서 이를 넘지는 않았고 최고 성능도 38개 중 절반에 한정됐다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)