OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

발행일
출처
arXiv
논문 번호
985
분야
Computer Vision
arXiv 번호
2608.21360

영상+음성+텍스트를 동시에 다루는 옴니 LLM이 실시간 영상 비서 역할을 얼마나 잘 하는지 측정한 체계적 벤치마크다. 최고 모델도 100점 만점에 66점에 그쳤다.

이 논문은 한마디로 'AI가 영상을 보며 실시간으로 사람을 도와주는 능력'을 제대로 측정한 벤치마크 논문이다. 기존 영상 이해 평가는 정해진 영상에 정적 질문을 던지는 방식이라, 모델 답변에 따라 사용자 행동이 달라지는 상호작용 상황을 담지 못한다. 저자들은 인터넷 영상을 역설계해 다중 턴 상호작용을 시뮬레이션하는 300개 영상·685개 QA 데이터를 만들었다(전문가 1000시간 이상 투입). 그 결과 최고 성능 모델(Gemini-3-Pro)도 66.4점/100점에 그쳤고, 손제스처 이해, 장기 기억, 타이밍 맞춤 응답, 턴 간 맥락 유지가 공통 약점으로 드러났다.

핵심 요약

  • 모델 답변에 따라 사용자 행동이 갈라지는 문제를 줄이기 위해 원본 영상에서 상호작용 경로를 미리 정하고 그 경로를 따라 평가하게 했다.
  • 인터넷 영상을 역설계하고 전문가 작업 1000시간 이상을 들여 일곱 과제와 열여섯 세부 과제, 세 가지 실사 사례를 구축했다.
  • 최고 모델 Gemini-3-Pro는 100점 만점에 66.4점, 공개 모델 Qwen3-Omni-Instruct는 51.2점에 그쳤다.
  • 손동작 지시 이해와 장기 기억, 목표 사건까지 답변을 미루는 능력, 여러 대화 차례의 목표 유지가 공통 병목으로 드러났다.
  • 정적 평가를 가능하게 하려고 상호작용 경로를 미리 고정했으므로, 실제 사용자와 모델이 자유롭게 선택하며 갈라지는 모든 대화 경로를 재현하지는 못한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)