GR2 Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 536
- 분야
- Information Retrieval
- arXiv 번호
- 2606.31984
Meta의 산업용 LLM 리랭커. Semantic ID 미드트레이닝 + 추론 증류 + RL로 산업 트래픽에서 +18.7% R@1 달성. SFT 대신 OPD 제안.
GR2는 대규모 추천 시스템의 최종 리랭킹 단계에 LLM 추론을 도입한 엔드투엔드 프레임워크다. Semantic ID 미드트레이닝, 교사 모델 추론 증류, 검증 가능한 보상 기반 RL을 결합한다. 산업 규모에서 SFT가 붕괴하는 문제를 해결하기 위해 On-Policy Distillation(OPD)을 제안하며, 컨텍스트 압축기로 훈련 비용을 절감한다.
핵심 요약
- Semantic ID(≥99% 고유성) 미드트레이닝으로 LLM이 카탈로그 아이템을 직접 추론
- 강한 교사 모델(32B)에서 추론 트레이스 증류 → 학생 모델(8B)에 추론 사전 설치
- DAPO 기반 RL + 다중 보상(포맷+AUC/NDCG+LLM-as-judge)으로 리랭킹 특화 최적화
- 산업 트래픽 +18.7% R@1, +7.1% R@3, +9.6% N@3 개선
- On-Policy Distillation(OPD): 1.7B 모델로 32B 교사 이득의 ≈82%를 5% 크기로 회복
- 리워드 해킹(들어오는 순서 보존, 위치 편향) 방지용 조건부 보상 설계 필수
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.