VisualClaw: A Real-Time, Personalized Agent for the Physical World

발행일
출처
arXiv
논문 번호
441
분야
Computer Vision
arXiv 번호
2606.16295

VLM 에이전트의 API 비용을 98% 절감하면서 정확도를 높이는 자가진화 멀티모달 에이전트 VisualClaw를 제안한다.

VisualClaw는 하이브리드 인코딩(캐스케이드 게이트로 불필요 프레임 필터링 + hot/cold 스킬 주입)과 자가진화(실패 기반 오프라인 evolver) 두 축으로 구성된다. 4개 video-QA 벤치마크에서 Gemini 3 Flash/GPT-5.2 기준 프레임당 API 비용을 평균 98% 절감하면서도 정확도는 평균 +3.85% 향상시킨다. 추가로 200개 시나리오의 VisualClawArena 벤치마크를 구축해, Codex와 Claude Code 백엔드 모두에서 self-evolution이 +2.9~3.2% 정확도 향상을 가져옴을 입증했다. AI 안경 등 엣지 환경에 적합한 설계다.

핵심 요약

  • 캐스케이드 게이트(perceptual hash → 128-dim CPU encoder → adaptive change gate)로 1시간 스트리밍을 5-20회 API 호출로 압축
  • Hot/cold top-k 스킬 주입으로 스킬 뱅크 증가에 따른 프롬프트 비용 폭증 방지
  • 실패 기반 오프라인 evolver가 memory와 skill bank를 자동 갱신—가중치 업데이트 없이 self-evolution 달성
  • 4개 video-QA 벤치마크에서 API 비용 평균 −98%, 정확도 평균 +3.85% (EgoSchema peak +15.80%)
  • 200개 시나리오 VisualClawArena 구축—5단계 curation 파이프라인으로 workspace-style 에이전트 평가 지원
  • Codex(GPT-5.5) +2.9%, Claude Code(Sonnet 4.6) +3.2% macro accuracy 향상, 비용 −9.5% 절감

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)