ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning

발행일
출처
arXiv
논문 번호
081
분야
RL / Writing
arXiv 번호
2509.04903

ACE-RL 프레임워크는 추상적인 지시를 검증 가능한 제약으로 변환하고 이를 강화학습을 위한 적응적이고 제약 강화된 보상에 반영함으로써, 대규모 언어 모델의 장문 콘텐츠 생성을 강화한다.

ACE-RL 프레임워크는 추상적인 지시를 검증 가능한 제약으로 변환하고 이를 강화학습을 위한 적응적이고 제약 강화된 보상에 반영함으로써, 대규모 언어 모델의 장문 콘텐츠 생성을 강화한다. 이 방법은 모델이 복잡하고 지시 특화된 요구사항을 정밀하게 준수하는 출력을 생성하게 하여, 기존 베이스라인과 독점 LLM을 능가하는 우수한 성능을 입증한다.

핵심 요약

  • 장문 생성을 위한 기존 지도 미세조정(SFT) 접근법은 희소하고 비용이 큰 고품질 데이터셋에 크게 의존한다.
  • 현재의 강화학습(RL) 방법은 거칠고 주관적인 평가 지표를 사용하여, 고품질 장문 작성에 핵심적인 미묘하고 지시 적응적인 요구를 포착하지 못한다.
  • LLM은 복잡한 장문 생성 과제에서 세밀하고 다면적이며 지시 특화된 요구사항을 일관되게 충족하는 데 어려움을 겪는다.
  • 강력한 LLM을 사용하는 자동화 파이프라인이 고수준 사용자 지시를 콘텐츠 완전성, 구조적 논리, 문체적 형식에 걸친 검증 가능한 제약 체크리스트로 분해한다.
  • 새로운 보상 메커니즘은 길이 보상과 세밀한 제약 보상을 결합하며, 더 작은 검증자 LLM이 각 제약의 충족 여부를 3단계 판정으로 평가한다.
  • 훈련에는 Group Relative Policy Optimization(GRPO) 알고리즘이 사용되며, 이 포괄적 보상을 통해 LLM이 길이와 지시 적응적 요구를 모두 충족하는 장문 응답을 생성하도록 유도한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)