AFUN: Towards an Affordance Foundation Model for Functionality Understanding

발행일
출처
arXiv
논문 번호
302
분야
Robotics
arXiv 번호
2606.02551

어포던스 이해는 시각 인지와 물리적 행동을 연결하며, 개방적이고 비정형적인 실세계 환경에서 로봇 조작을 위한 설명 가능한 인터페이스 역할을 한다.

AFUN은 로봇이 물체의 어디를 어떻게 움직여야 하는지를 한 모델에서 이해하도록 만든 어포던스 모델이다. 한 장의 RGB-D 영상과 글로 된 과제를 받아 접촉할 영역의 마스크와 접촉 뒤 3D 이동 곡선을 함께 예측한다. 로봇 시연, 사람 영상, 시뮬레이션과 실제 스캔을 언어·마스크·물체 중심 움직임이라는 공통 형식으로 바꾸는 대규모 자료 파이프라인을 구축했다. 네 벤치마크의 여덟 시험 세트에서 분할 점수를 크게 높였고, 접촉점 적중률은 가장 좋은 비교 방법보다 12.7~61.3% 높았으며 세 움직임 시험에서도 가장 좋았다. 다만 학습 자료에 비슷한 물체나 동작이 전혀 없으면 정확한 움직임을 예측하기 어려워, 실제 로봇에서는 안전 장치와 과제별 검증이 필요하다.

핵심 요약

  • 기존 방법들은 보통 이 과제의 일부만 다룬다. 실행 가능한 동작을 명시하지 않은 채 작업 관련 영역만 위치를 추정하거나, 동작을 예측하더라도 확장성이 제한적이다.
  • 이 논문은 기능 이해를 위한 어포던스 파운데이션 모델로 나아가는 한 걸음인 ourmodel을 제시한다.
  • 단일 RGB-D 관측과 언어로 된 작업 설명으로부터 ourmodel은 작업 조건부 기능 마스크(어디를 상호작용할지)와 3D 접촉 후 동작 곡선(어떻게 상호작용할지)을 예측한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)