Hierarchical Denoising For Multi-Step Visual Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 652
- 분야
- Computer Vision
- arXiv 번호
- 2607.15278
비디오 생성 모델에 계층적 노이즈 제거 구조를 넣어, 미로 찾기나 소코반 같은 다단계 시각 추론 정확도를 76% 끌어올린 연구다.
이 논문은 한마디로 비디오 생성 모델이 미로 찾기, 하노이 탑, 소코반 같은 다단계 추론을 잘하도록 만든 프레임워크다. 기존 스트리밍 방식은 빠르지만 한 번 결정하면 되돌릴 수 없어 추론이 틀어지고, 양방향 확산 방식은 정확하지만 너무 느리다. HDR는 비디오를 트리 구조로 组织해서 대략적인 계획부터 세부 장면까지 단계적으로 다듬는다. 6개 추론 과제에서 성공률을 34%에서 60%로 올렸고 (76% 향상), 양방향 확산보다 54배 빠르다. 실제 로봇 실험에서도 효과를 확인했다.
핵심 요약
- 비디오 생성에서 '빠르지만 멍청한' 스트리밍 방식과 '똑똑하지만 느린' 양방향 방식의 한계를 트리 구조로 해결했다.
- 미로 찾기, 소코반, 하노이 탑 등 6개 다단계 추론 과제에서 성공률을 34.22에서 60.29로, 76.2% 향상시켰다.
- 스트리밍 속도는 0.70초/프레임으로 양방향 확산보다 54배 빠르면서 추론 정확도는 더 높다.
- 학습 데이터의 2%만 써도 전체 데이터의 82.9% 성능을 유지해 데이터 효율성이 뛰어나다.
- 실제 로봇 팔 미로 실험에서도 강건한 성공률을 보이며 물리 세계 적용 가능성을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.