OLMo 2

발행일
출처
arXiv
논문 번호
003
분야
LLMs / Open Models
arXiv 번호
2501.00656

OLMo 2가 중요한 이유는 가중치뿐 아니라 전체 학습 스택을 공개하기 때문이다.

OLMo 2는 7B, 13B, 32B 규모의 완전 공개 밀집 자기회귀 언어 모델 제품군이다. 이 공개에는 모델 가중치, 학습 데이터, 학습 코드, 레시피, 로그, 그리고 다수의 중간 체크포인트가 포함되어, 가중치만 공개하는 모델에 비해 이례적으로 투명하다. 이 논문은 안정성과 토큰당 효율을 위한 구조 및 학습 레시피 변경에 초점을 맞추고, Dolmino Mix 1124 데이터 혼합을 도입하며, 어닐링 단계에서 후기 커리큘럼 학습을 사용한다. 명령어 튜닝의 경우 OLMo 2-Instruct는 Tülu 3의 기법과 검증 가능한 보상을 사용하는 강화학습을 통합한다. 보고된 결과는 OLMo 2가 성능 대 학습 연산량의 파레토 경계 근처에 위치하며, 전체 레시피를 공개하면서도 비슷한 수준의 가중치 공개 모델과 동등하거나 이를 능가하는 경우가 많음을 보여준다.

핵심 요약

  • 공개 범위는 가중치, 데이터, 코드, 레시피, 로그, 중간 체크포인트를 모두 제공하여, 재현 가능한 연구와 다운스트림 적응에 유용한 모델이 된다.
  • 학습 레시피에서 Dolmino Mix 1124와 후기 커리큘럼 학습은 단순히 더 큰 연산량에 의존하지 않고도 다운스트림 능력을 향상시킨다.
  • 명령어 모델인 OLMo 2-Instruct는 Tülu 3 기법을 토대로 하며, 마지막 단계의 검증 가능한 보상을 사용하는 강화학습으로 이를 확장한다.
  • 결과적으로 기본 모델은 더 투명함을 유지하면서도 Llama 3.1, Qwen 2.5, Gemma 2 계열의 가중치 공개 시스템과 경쟁력이 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)