AFUN: Towards an Affordance Foundation Model for Functionality Understanding
- 발행일
- 출처
- arXiv
- 논문 번호
- 302
- 분야
- Robotics
- arXiv 번호
- 2606.02551
어포던스 이해는 시각 인지와 물리적 행동을 연결하며, 개방적이고 비정형적인 실세계 환경에서 로봇 조작을 위한 설명 가능한 인터페이스 역할을 한다.
AFUN은 로봇이 물체의 어디를 어떻게 움직여야 하는지를 한 모델에서 이해하도록 만든 어포던스 모델이다. 한 장의 RGB-D 영상과 글로 된 과제를 받아 접촉할 영역의 마스크와 접촉 뒤 3D 이동 곡선을 함께 예측한다. 로봇 시연, 사람 영상, 시뮬레이션과 실제 스캔을 언어·마스크·물체 중심 움직임이라는 공통 형식으로 바꾸는 대규모 자료 파이프라인을 구축했다. 네 벤치마크의 여덟 시험 세트에서 분할 점수를 크게 높였고, 접촉점 적중률은 가장 좋은 비교 방법보다 12.7~61.3% 높았으며 세 움직임 시험에서도 가장 좋았다. 다만 학습 자료에 비슷한 물체나 동작이 전혀 없으면 정확한 움직임을 예측하기 어려워, 실제 로봇에서는 안전 장치와 과제별 검증이 필요하다.
핵심 요약
- 기존 방법들은 보통 이 과제의 일부만 다룬다. 실행 가능한 동작을 명시하지 않은 채 작업 관련 영역만 위치를 추정하거나, 동작을 예측하더라도 확장성이 제한적이다.
- 이 논문은 기능 이해를 위한 어포던스 파운데이션 모델로 나아가는 한 걸음인 ourmodel을 제시한다.
- 단일 RGB-D 관측과 언어로 된 작업 설명으로부터 ourmodel은 작업 조건부 기능 마스크(어디를 상호작용할지)와 3D 접촉 후 동작 곡선(어떻게 상호작용할지)을 예측한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.