HumanCLAW: Can Vision-Language Models Act Through a Body?

발행일
출처
arXiv
논문 번호
759
분야
Computer Vision
arXiv 번호
2607.27180

VLM이 물리적 몸을 통해 행동할 수 있는지 평가하는 벤치마크로, 최고 모델도 16.8% 성공률에 그친 것을 발견.

이 논문은 한마디로 '시각-언어 모델(VLM)에게 인간의 몸을 주면 얼마나 잘 행동할 수 있을까?'를 정량적으로 평가한 것이다. HumanCLAW는 VLM의 의사결정을 저수준 모터 제어와 분리해, 실패 원인이 모델의 판단 오류인지 구별할 수 있게 설계했다. 9개 최고 성능 VLM을 테스트한 결과, 최고 모델도 16.8% 성공률에 그쳤다. 핵심 병목은 인식이 아니라 '자기 몸 상태 파악(embodied self-awareness)' 부족이었다.

핵심 요약

  • VLM의 행동 의사결정과 모터 제어를 분리해 순수하게 판단 능력만 평가하는 프레임워크를 만들었다.
  • 1,218개의 에고센트릭 탐색-상호작용 에피소드, 41개 실내 씬으로 구성된 HumanCLAW-Bench를 구축했다.
  • 9개 최첨단 VLM 중 최고 모델도 16.8% 성공률에 그쳤다.
  • 실패의 핵심 원인은 인식이 아니라 '내 몸이 어디 있는지, 도착했는지, 부딪혔는지'를 모르는 자기 인식 부족이었다.
  • 현재 VLM은 세상을 '묘사'할 뿐, 자신이 통제하는 몸을 '느끼지' 못한다는 결론을 도출했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)