VisualClaw: A Real-Time, Personalized Agent for the Physical World
- 발행일
- 출처
- arXiv
- 논문 번호
- 441
- 분야
- Computer Vision
- arXiv 번호
- 2606.16295
VLM 에이전트의 API 비용을 98% 절감하면서 정확도를 높이는 자가진화 멀티모달 에이전트 VisualClaw를 제안한다.
VisualClaw는 하이브리드 인코딩(캐스케이드 게이트로 불필요 프레임 필터링 + hot/cold 스킬 주입)과 자가진화(실패 기반 오프라인 evolver) 두 축으로 구성된다. 4개 video-QA 벤치마크에서 Gemini 3 Flash/GPT-5.2 기준 프레임당 API 비용을 평균 98% 절감하면서도 정확도는 평균 +3.85% 향상시킨다. 추가로 200개 시나리오의 VisualClawArena 벤치마크를 구축해, Codex와 Claude Code 백엔드 모두에서 self-evolution이 +2.9~3.2% 정확도 향상을 가져옴을 입증했다. AI 안경 등 엣지 환경에 적합한 설계다.
핵심 요약
- 캐스케이드 게이트(perceptual hash → 128-dim CPU encoder → adaptive change gate)로 1시간 스트리밍을 5-20회 API 호출로 압축
- Hot/cold top-k 스킬 주입으로 스킬 뱅크 증가에 따른 프롬프트 비용 폭증 방지
- 실패 기반 오프라인 evolver가 memory와 skill bank를 자동 갱신—가중치 업데이트 없이 self-evolution 달성
- 4개 video-QA 벤치마크에서 API 비용 평균 −98%, 정확도 평균 +3.85% (EgoSchema peak +15.80%)
- 200개 시나리오 VisualClawArena 구축—5단계 curation 파이프라인으로 workspace-style 에이전트 평가 지원
- Codex(GPT-5.5) +2.9%, Claude Code(Sonnet 4.6) +3.2% macro accuracy 향상, 비용 −9.5% 절감
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.