RoboTTT: Context Scaling for Robot Policies

발행일
출처
arXiv
논문 번호
641
분야
Robotics
arXiv 번호
2607.15275

로봇 정책의 컨텍스트 길이를 8K 타임스텝으로 늘려, 한 번의 영상 시연만으로 새 동작을 배우는 로봇 모델.

이 논문은 한마디로 로봇이 더 긴 과거 기록을 활용할 수 있게 해주는 Test-Time Training 기반 로봇 정책이다. 기존 로봇 모델들은 1~8스텝 정도만 기억하는데, RoboTTT는 8K 스텝까지 늘리면서도 추론 속도는 그대로다. 이로써 인간 영상 시연 한 번으로 새 동작을 모방하고, 실시간으로 성능이 개선되며, 5분짜리 10단계 조립 작업을 끝까지 완수한다.

핵심 요약

  • Test-Time Training(빠른 가중치)을 VLA 모델에 통합해 8K 타임스텝 컨텍스트를 달성했다. 추론 지연은 늘어나지 않는다.
  • 인간 영상 시연 1회만으로 새 동작을 모방(원샷 모방)하는 능력을 얻었다. 베이스라인은 전부 실패한 반면 6/10 성공.
  • DAgger Distillation으로 실시간 성능 개선이 가능해져 외란 하에서 83% 성공(기존 최고 53%).
  • 전체 작업 성공률이 단일 스텝 대비 87% 향상됐고, 5분 10단계 조립을 끝까지 완수했다(기존 어떤 모델도 불가).
  • 컨텍스트 길이를 1K→8K로 늘리자 62% 더 좋은 성과가 나왔다. 로봇에서도 컨텍스트가 스케일링 축이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)