OneReason Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 361
- 분야
- Information Retrieval
- arXiv 번호
- 2606.06260
생성형 추천 모델에 CoT 추론을 성공적으로 부여한 OneReason 프레임워크다. itemic token의 지각(perception) 정렬과 인지 강화(cognition) CoT 포맷을 결합하여, Kuaishou 실서비스에서 thinking mode가 non-thinking mode를 일관되게 능가한다.
기존 생성형 추천 모델(OneRec)에 LLM의 think-before-answer 패러다임을 적용하려 했으나, thinking mode가 non-thinking mode를 능가하지 못하는 문제가 있었다. OneReason은 이 원인을 두 가지로 진단한다: itemic token과 자연어 간 정렬(perception) 부족, CoT 품질(cognition) 부족. 이를 해결하기 위해 (1) pre-training에서 강한 itemic token 지각 학습, (2) R0-R3 3수준 인지 강화 CoT 포맷으로 SFT, (3) specialize-then-unify RL 훈련 레시피를 제안한다. Kuaishou의 단비디오·라이브·광고·전자상거래 실서비스 벤치마크에서 thinking mode가 non-thinking mode를 일관되게 능가하며, CoT supervision이 non-thinking inference까지 향상시키는 전이 효과도 관찰된다.
핵심 요약
- 생성형 추천에서 thinking mode가 non-thinking mode를 능가하지 못하는 문제의 원인을 perception + cognition 두 축으로 분석
- Pre-training에서 itemic tokenizer와 4-granularity 학습으로 강한 itemic token 지각 확보
- R0(Perception) → R1(Derivation) → R2(Evolution) → R3(Recommendation) 3수준 인지 강화 CoT SFT
- Specialize-then-unify RL: 태스크별 전문화 후 통합하여 thinking 능력 강화
- Kuaishou 실서비스 멀티도메인 벤치마크에서 thinking mode > non-thinking mode 일관 달성
- CoT supervision이 non-thinking inference까지 향상시키는 전이 효과 발견
- OneReason-8B 및 0.8B 모델 오픈소스 예정
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.