Phi-4-reasoning-vision-15B Technical Report

발행일
출처
arXiv
논문 번호
128
분야
Multimodal / Reasoning
arXiv 번호
2603.03975

Microsoft Research는 2,000억 개의 멀티모달 토큰을 사용해 더 큰 모델보다 훨씬 적은 데이터로 경쟁력 있는 정확도를 달성하는 컴팩트한 오픈 웨이트 멀티모달 추론 모델 Phi-4-reasoning-vision-15B를 소개한다.

Microsoft Research는 2,000억 개의 멀티모달 토큰을 사용해 더 큰 모델보다 훨씬 적은 데이터로 경쟁력 있는 정확도를 달성하는 컴팩트한 오픈 웨이트 멀티모달 추론 모델 Phi-4-reasoning-vision-15B를 소개한다. 과학과 수학 추론, 컴퓨터 사용 과제에서 뛰어난 이 모델은 세심하게 선별된 데이터와 고해상도 동적 비전 인코더가 효율적 성능의 핵심임을 보여준다.

핵심 요약

  • 비전-언어 모델(VLM)의 지배적 추세는 모델 규모를 지속적으로 키우는 것으로, 이는 학습과 추론에 막대한 계산 비용을 초래하여 광범위한 배포를 저해한다.
  • 많은 기존 멀티모달 모델은 부족한 지각 능력으로 인해, 컴퓨터 사용 에이전트를 위한 사용자 인터페이스 이해처럼 세밀한 시각적 디테일을 요구하는 과제에 어려움을 겪는다.
  • 엄청나게 큰 자원을 요구하지 않으면서도 효율적이면서 유능한 멀티모달 추론을 달성할 수 있는 실용적 통찰과 오픈 웨이트 모델이 필요하다.
  • SigLIP-2 비전 인코더와 Phi-4-Reasoning LLM 백본을 활용하는 중간 융합 구조의 150억 파라미터 오픈 웨이트 멀티모달 모델 Phi-4-reasoning-vision-15B를 개발했다.
  • MLP 사전학습, 다양하고 세심하게 선별된 데이터셋에 대한 광범위한 지시 튜닝, 그리고 긴 컨텍스트와 다중 이미지, 책임 있는 AI(RAI) 데이터를 위한 최종 단계로 구성된 3단계 학습 레시피를 구현했다.
  • 체계적 필터링, AI 보조 오류 수정, 합성 증강을 통해 데이터 품질을 강조했으며, 고해상도 시각 지각을 최적화하기 위해 동적 해상도 비전 인코더를 통합했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)