Kwai Keye-VL-2.0 Technical Report

발행일
출처
arXiv
논문 번호
382
분야
Computer Vision
arXiv 번호
2606.10651

Kwai의 오픈소스 MoE 멀티모달 모델 Keye-VL-2.0-30B-A3B 기술 보고서. DeepSeek Sparse Attention을 GQA 기반 멀티모달 아키텍처에 최초 적용해 256K 컨텍스트를 무손실 처리한다.

Keye-VL-2.0-30B-A3B은 3B 활성 파라미터를 가진 30B급 MoE 멀티모달 기반 모델로, 시간 단위 비디오 이해와 에이전트 지능을 목표로 한다. DeepSeek Sparse Attention(DSA)을 GQA 기반 멀티모달 아키텍처에 최초로 적용하여 256K 컨텍스트를 무손실 처리하며, Cross-Modal Multi-Teacher On-Policy Distillation(MOPD)을 통해 다중 태스크 정렬 시의 catastrophic forgetting을 극복한다. TimeLens, Video-MME-v2, LongVideoBench 등에서 동급 모델 대비 최고 수준 성능을 달성했다.

핵심 요약

  • 30B MoE 구조(3B 활성 파라미터)로 효율적 배포 가능한 멀티모달 기반 모델
  • GQA 기반 아키텍처에 DeepSeek Sparse Attention 최초 적용으로 256K 무손실 컨텍스트
  • Cross-Modal MOPD로 비디오·코드·도구·검색 역량을 하나의 MoE 백본에 통합
  • Context-RL + Video-RL로 시각 hallucination 감소 및 장문 의사결정 안정화
  • TimeLens(ActivityNet 58.5 mIoU), LongVideoBench(74.1) 등에서 동급 SOTA 달성
  • 에이전트 벤치마크(LiveCodeBench v6 64.2, OJBench 71.5)에서도 강력한 성능

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)