AVA-Encoder: Towards Agent-Native Video Representation Learning

발행일
출처
arXiv
논문 번호
885
분야
Computer Vision
arXiv 번호
2608.12313

이 논문은 완성된 영상을 에이전트가 읽고 고칠 수 있는 지식 그래프로 바꾸고, 영상 복원 오류를 이용해 표현 자체를 개선하는 AVA-Encoder를 제안했다.

이 논문은 한마디로 영화 영상을 에이전트가 직접 검색하고 편집할 수 있는 구조로 바꾸는 방법을 제안한다. AVA-Encoder는 이야기를 사건과 장면으로 나누고, 인물, 배경, 물체, 카메라와 오디오 정보를 글과 자산으로 연결한 지식 그래프를 만든다. 이 그래프에서 영상을 다시 만든 뒤 원본과의 차이를 자연어 수정 지침으로 바꿔 공통 인코딩 정책과 영상별 그래프를 개선한다. 이 구조는 영상 재구성 평가뿐 아니라 장면 사이의 관계를 유지하는 편집에도 활용된다.

핵심 요약

  • 이야기, 사건, 장면 계층 아래에 인물, 배경, 물체, 스타일, 카메라와 오디오 상태를 두고 관련 자산을 연결한다.
  • 복원 영상의 오류를 자연어 수정 지침으로 바꿔 공통 인코딩 정책과 영상별 지식 그래프를 두 단계로 개선한다.
  • 정책 개선에는 영상 6개를 사용했고, 평가는 겹치지 않는 영상 18개와 장면 129개, 핵심 화면 246개로 진행했다.
  • 종합 재구성 점수는 49.0%로 가장 강한 외부 비교 방법의 28.3%보다 20.7%포인트 높았다.
  • 정책만 비교했을 때 45.8%로 사람이 조정한 정책의 44.4%를 넘었고, 시스템 프롬프트는 31,336토큰에서 8,052토큰으로 줄었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)