MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories
- 발행일
- 출처
- arXiv
- 논문 번호
- 1161
- 분야
- memory
- arXiv 번호
- 2609.40195
이 논문은 수백 시간짜리 착용 카메라 영상을 질문 가능한 텍스트 기억으로 바꾸는 문제를 엔티티 중심 에피소드 기록과 시간 인덱스 검색으로 풀었다.
이 논문은 한마디로 긴 일상 영상을 잘 담은 텍스트 메모리로 바꿔 두고 나중에 질문에 답하는 시스템이다. 사람·장소 같은 대상을 짚어서(엔티티 그라운딩) 1인칭 이야기 형태로 기록하고, 시간 인덱스를 단 에이전트 리더가 필요한 기억을 찾아 답한다. 학습 없이도 4개 장기 벤치마크에서 최고 무학습 대비 4.6~12.0% 올렸고, 강화학습으로 기록기를 최적화하는 MemOpt를 얹으면 추가로 2.7~5.0% 더 좋아졌다. 무엇을 남기고 버릴지 정하는 압축의 딜레마를 시스템적으로 푼 게 핵심이다.
핵심 요약
- 영상을 무작정 다 저장하지 않고 대상과 시간을 짚은 1인칭 텍스트 에피소드로 바꿔, 나중에 찾기 쉬운 형태로 기억을 남겼다.
- 기억이 쌓일수록 비슷한 항목끼리 검색이 겹치는 문제를 시간 인덱스를 단 에이전트 리더로 풀어, 학습·추가 학습 없이 성능을 올렸다.
- 무학습 기준 최고 대비 4.6~12.0% 향상됐고, 강화학습으로 기록 자체를 최적화하면 2.7~5.0%가 더 개선됐다.
- 기록기·리더 모델을 바꿔도 효과가 유지돼서 특정 모델에만 묶이지 않는 범용 설계다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.