OneReason Technical Report

발행일
출처
arXiv
논문 번호
361
분야
Information Retrieval
arXiv 번호
2606.06260

생성형 추천 모델에 CoT 추론을 성공적으로 부여한 OneReason 프레임워크다. itemic token의 지각(perception) 정렬과 인지 강화(cognition) CoT 포맷을 결합하여, Kuaishou 실서비스에서 thinking mode가 non-thinking mode를 일관되게 능가한다.

기존 생성형 추천 모델(OneRec)에 LLM의 think-before-answer 패러다임을 적용하려 했으나, thinking mode가 non-thinking mode를 능가하지 못하는 문제가 있었다. OneReason은 이 원인을 두 가지로 진단한다: itemic token과 자연어 간 정렬(perception) 부족, CoT 품질(cognition) 부족. 이를 해결하기 위해 (1) pre-training에서 강한 itemic token 지각 학습, (2) R0-R3 3수준 인지 강화 CoT 포맷으로 SFT, (3) specialize-then-unify RL 훈련 레시피를 제안한다. Kuaishou의 단비디오·라이브·광고·전자상거래 실서비스 벤치마크에서 thinking mode가 non-thinking mode를 일관되게 능가하며, CoT supervision이 non-thinking inference까지 향상시키는 전이 효과도 관찰된다.

핵심 요약

  • 생성형 추천에서 thinking mode가 non-thinking mode를 능가하지 못하는 문제의 원인을 perception + cognition 두 축으로 분석
  • Pre-training에서 itemic tokenizer와 4-granularity 학습으로 강한 itemic token 지각 확보
  • R0(Perception) → R1(Derivation) → R2(Evolution) → R3(Recommendation) 3수준 인지 강화 CoT SFT
  • Specialize-then-unify RL: 태스크별 전문화 후 통합하여 thinking 능력 강화
  • Kuaishou 실서비스 멀티도메인 벤치마크에서 thinking mode > non-thinking mode 일관 달성
  • CoT supervision이 non-thinking inference까지 향상시키는 전이 효과 발견
  • OneReason-8B 및 0.8B 모델 오픈소스 예정

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)