Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 1003
- 분야
- Robotics
- arXiv 번호
- 2608.23478
이 논문은 로봇 팔 모델에게 '이 행동이 무엇을 노리는지'라는 의도를 가르쳐, 행동 복제만 할 때보다 성공률을 크게 올렸다.
이 논문은 한마디로 로봇 행동 학습에 '의도'를 넣은 연구다. 기존 VLA 모델은 어떤 모터 명령을 흉내 낼지는 배우지만, 그 행동이 왜 필요한지는 배우지 않는다. INDI는 고정된 교사 VLM이 실행 영상을 보고 행동 의도 표현을 만들면, 학생 디코더가 이를 중간층에서 복원해 행동 예측에 쓰게 한다. SimplerEnv-Bridge에서 GR00T-N1.7을 64.3%에서 84.7%로 끌어올렸다.
핵심 요약
- 행동 복제에 그치지 않고 행동의 국소 목적(의도)을 명시적 감독 신호로 증류했다.
- 교사 추론과 목표 생성은 오프라인에서 한 번만 하고 배포 때는 교사 쪽 모듈을 전부 떼어내, 기존 VLA에 얹어도 실행 부담은 디코더 표현이 늘어난 만큼에 그친다.
- SimplerEnv-Bridge에서 GR00T-N1.7 64.3%→84.7%(+20.4%p), RoboCasa 64.1%→70.3%를 달성했다.
- 실기 과제 평균 62.0%→68.7%, 긴 과제에서 최대 +12%p 향상됐다.
- 다만 의도의 의미가 교사 VLM이 아는 범위에 갇혀서, 신체 경험이 없는 교사를 쓰면 목표에 방향성이 거의 사라지고 성능이 행동만 따라 배우는 기준선보다도 떨어졌다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.