TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
- 발행일
- 출처
- arXiv
- 논문 번호
- 669
- 분야
- Computer Vision
- arXiv 번호
- 2607.17423
영상에서 "무슨 일이 있었나"뿐 아니라 "언제 나왔나"를 여러 구간 묶음으로 집어내는 범용 모델을, 검증형 데이터 구축과 새 강화학습 보상으로 만들었다.
영상 멀티모달 LLM은 내용을 설명은 잘하지만 그 근거가 영상 어디에 있는지는 잘 못 짚는다. TimeLens2는 근거를 개수가 정해지지 않은 구간 집합으로 보고, 데이터 만들 때부터 학습까지 일관되게 그 형태로 다룬다. 데이터는 캡션 기반 후보 제안, 독립 위치찾기, 여러 에이전트 합의, 의미 검증, 경계 다듬기의 단계로 93K를 만들었다. 학습은 지도학습으로 능력을 익히고 GRPO 강화학습으로 위치를 보정하는데, 겹침 지표(tIoU)에 더해 1차원 Wasserstein 거리 보상을 써서 안 겹치는 예측에도 방향을 준다. 7개 벤치마크에서 2B, 4B, 8B 모델이 각각 백본 대비 14.2, 13.0, 18.1 mIoU 올랐고 397B 오픈 모델도 넘었다.
핵심 요약
- 영상 근거 찾기를 하나의 구간이 아니라 개수가 변하는 구간 집합 문제로 정의했다. 긴 영상, 여러 번 반복되는 장면, 1인칭 영상, 질문형 요청까지 한 모델로 다룬다.
- 데이터 품질 문제를 한 번에 라벨을 다는 방식 대신 단계별 검증으로 풀었다. 후보 제안, 독립 재탐색, 에이전트 합의, 의미 검증, 경계 정밀화 순으로 좁혀간다.
- 핵심 기법은 시간 Wasserstein 보상이다. 예측 구간과 정답 구간을 각각 균등 분포로 보고 정확한 1차원 W1 거리를 계산해, 짝짓기 없이도 조밀한 피드백을 준다.
- 겹침 기반 보상(tIoU)은 예측이 정답과 하나도 안 겹치면 모두 0이라 학습 신호가 없다. Wasserstein 보상은 이 상황에서 아깝게 빗나간 경우와 멀리 빗나간 경우를 구분해준다.
- 실측으로 보상이 전부 같아 학습이 안 되던 그룹 비율이 13.8%에서 3.6%로 줄었고, 전부 0이던 그룹의 75.8%가 다시 순위를 갖게 됐다.
- 작은 모델이 훨씬 큰 모델을 이겼다는 점이 실용적이다. 답변에 시간 근거를 붙여 사람이 확인할 수 있게 만드는 방향이 통한다는 증거다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.