VISTA: A Visual Harness for Reasoning in an Interactive World
- 발행일
- 출처
- arXiv
- 논문 번호
- 1147
- 분야
- AI / Agents
- arXiv 번호
- 2610.02200
이 논문은 AI가 앞서 본 화면을 잊는 문제를 원본 화면 저장과 필요한 부분 다시 보기로 풀었다.
이 논문은 한마디로 AI에게 화면을 다시 꺼내 볼 수 있는 시각 기억을 붙인 연구다. VISTA는 관찰한 화면을 원본 그대로 저장하고 필요한 장면이나 작은 영역을 다시 보여준다. 공개 게임 25개를 모두 풀었고, BabyVision의 시각 추적 문제에서는 정답률을 41.0%에서 63.2%로 높였다. 다만 공개 문제의 학습 데이터 포함 가능성은 배제하지 못했다.
핵심 요약
- 과거 화면을 원본 그대로 보관하고 필요한 장면을 확대해 다시 확인하도록 설계했다.
- 공개 ARC-AGI-3 게임 25개를 모두 해결하고 처음 참여한 사람보다 행동 횟수를 57.4% 줄였다고 보고했다.
- BabyVision 시각 추적 문제 39개에서 정답률을 41.0%에서 63.2%로 높였다고 보고했다.
- 공개 게임이 모델 학습에 포함됐을 가능성은 배제할 수 없다고 명시했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.