Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 882
- 분야
- Robotics
- arXiv 번호
- 2608.11204
이 논문은 수술 로봇이 동작 라벨이 없는 내시경 영상만으로 먼저 수술 장면의 변화를 학습한 뒤, 적은 양의 동작 데이터로도 정교한 수술 조작을 수행할 수 있게 하는 방법을 제안한다.
이 논문은 한마디로 수술 로봇 학습의 데이터 부족 문제를, 동작 라벨이 없는 내시경 비디오만으로 해결하는 방법을 제시한다. Surgical WAM은 먼저 수술 비디오에서 장면의 시각적 변화(역학)를 학습한 뒤, 같은 모델에 동작 데이터를 추가 학습시킨다. 이렇게 하면 적은 동작 데이터로도 정교한 수술 조작이 가능해진다. 4개 수술 작업에서 비디오 사전학습으로 평균 성공률이 63.5%에서 77.8%로 올랐으며, 특히 양손 협력 작업에서 20%p 향상을 보였다.
핵심 요약
- 동작 라벨 없는 내시경 비디오로 먼저 수술 장면의 시각적 역학을 학습한 뒤, 동작 라벨이 있는 소량 데이터로 미세 조정하는 2단계 학습법을 제안했다.
- 4개 SurRoL 벤치마크 작업에서 비디오 사전학습으로 평균 성공률 63.5% → 77.8% 향상을 달성했다.
- PegTransfer 작업에서 20%p 절대 향상(66% → 86%), 특히 접촉이 많고 양손 협력이 필요한 작업에서 효과가 컸다.
- 비디오 사전학습 모델이 절반의 미세조정 단계로 더 높은 성능에 도달해 학습 효율도 크게 개선했다.
- 실제 수술 로봇 데이터(JIGSAW)에서도 같은 경향이 확인돼, 시뮬레이터의 산물이 아닌 진짜 효과임을 입증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.