AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

발행일
출처
arXiv
논문 번호
360
분야
Robotics
arXiv 번호
2606.06155

Affordance 예측을 구조적 중간 표현으로 도입하여 VLM 의미 공간과 3D 물리 행동 공간 간 격차를 해소하는 VLA 프레임워크다. Which2Act-Where2Act-How2Act 3단계 점진적 모델링이 핵심이며, 실제 로봇에서 Basic 88.3%, Complex 82.9% 성공률을 달성한다.

기존 VLA 모델은 VLM의 의미 공간과 3D 물리 행동 공간 간 구조적 불일치로 정밀한 지각-행동 매핑 학습이 어려웠다. AffordanceVLA는 객체 중심 그라운딩(Which2Act, visual latent prediction), 2D 상호작용 위치 파악(Where2Act, affordance map), 3D 기하학적 추론(How2Act)을 점진적으로 모델링하는 구조적 affordance 예측을 중간 표현으로 제안한다. Mixture-of-Transformer 아키텍처에 Understanding/Affordance Generation/Action 세 전문가를 배치하고, progressive data curriculum의 3단계 훈련과 자동 affordance 데이터 증강 파이프라인을 활용한다. LIBERO·CALVIN 벤치마크와 실제 로봇 실험에서 강건한 성능을 보이며, 특히 시각적 혼동 상황에서 언어 지시 구분 능력이 Pi0 대비 크게 향상되었다.

핵심 요약

  • VLM 의미 공간과 3D 물리 행동 공간 간 격차 해소를 위한 구조적 affordance 중간 표현 도입
  • Which2Act(visual latent prediction) → Where2Act(2D affordance map) → How2Act(3D 기하) 점진적 모델링
  • MoT 아키텍처: Understanding/Affordance Generation/Action 3개 전문가 모듈
  • 3-stage progressive training + 자동 affordance annotation 파이프라인으로 라벨 희소성 해결
  • 실제 로봇 Basic task 88.3%, Complex task 82.9% 성공률 (Pi0 대비 Complex +38.1%p)
  • Affordance가 VLM backbone의 시각-언어 능력을 보존하는 semantic anchor 역할 수행 가설

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)