OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
- 발행일
- 출처
- arXiv
- 논문 번호
- 167
- 분야
- Agents / Memory / Multimodal
- arXiv 번호
- 2604.26622
OCR-Memory는 상호작용 이력을 시각 토큰으로 광학적으로 인코딩하는 자율 LLM 에이전트용 메모리 프레임워크를 도입하여, 길었던 과거 경험을 완전하게 보존하고 결정론적이며 환각 없는 검색을 가능하게 한다.
OCR-Memory는 상호작용 이력을 시각 토큰으로 광학적으로 인코딩하는 자율 LLM 에이전트용 메모리 프레임워크를 도입하여, 길었던 과거 경험을 완전하게 보존하고 결정론적이며 환각 없는 검색을 가능하게 한다. 이 접근법은 텍스트 기반 방법 대비 더 높은 과제 성공률을 달성하고, 엄격한 토큰 예산 하에서도 높은 검색 정확도를 유지한다.
핵심 요약
- LLM은 유한한 컨텍스트 윈도를 가지므로, 장기 과제에서 에이전트가 효과적으로 보존하고 활용할 수 있는 과거 상호작용 이력의 양이 제한된다.
- 기존의 텍스트 기반 메모리 압축 기법은 디버깅 같은 복잡한 에이전트 작업에 결정적인 세밀한 구조적·절차적 세부 정보를 종종 잃게 한다.
- 텍스트 전용 검색 방법은 파편화되었거나 의미적으로 유사하지만 논리적으로 무관한 정보를 제공할 수 있고, 생성형 검색은 잘못된 증거를 환각할 위험이 있다.
- 이 프레임워크는 에이전트의 전체 상호작용 궤적을 고밀도 이미지로 시각적으로 인코딩한 뒤, OCR 모델을 사용해 이를 간결한 시각 토큰으로 압축한다.
- Locate-and-Transcribe 검색 패러다임은 시각적으로 표시된 메모리에서 특정 세그먼트 인덱스를 예측하여, 원문 그대로의 텍스트를 결정론적으로 가져오고 환각 위험을 완화한다.
- 적응형 다해상도 전략은 저장된 메모리의 시각적 충실도를 경과 시간에 따라 동적으로 조정하여 시각 토큰 비용을 줄이는 한편, 능동적 회상을 통해 필요 시 고충실도 세부 정보를 복원할 수 있게 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.