Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation

발행일
출처
arXiv
논문 번호
934
분야
Information Retrieval
arXiv 번호
2608.15949

추천 대화의 각 응답이 후보 불확실성을 얼마나 줄이는지 보상으로 삼아, 더 효율적인 질문과 추천을 배우게 하는 방법이다.

이 논문은 한마디로 여러 차례 추천 대화에서 후보의 불확실성을 가장 많이 줄이는 응답을 학습하는 방법을 제안한다. 같은 대화에서 모델이 여러 번 만든 추천 목록의 불확실성을 섀넌 엔트로피로 재고, 다음 사용자 답변 뒤 한 턴과 대화 전체에서 얼마나 줄었는지를 응답의 정보량으로 본다. 이 보상으로 좋은 지도 학습 사례를 고르거나 DPO 선호 학습의 응답 순위를 정한다. 엔트로피 보상 자체는 정답 영화 없이 계산할 수 있지만 실험의 원래 선호 쌍은 정답 적중을 포함한 CollabLLM 보상으로 만들었다. Llama 3.2 1B 실험에서 INSPIRED의 모의 대화 적중률은 27.94퍼센트, ReDial은 32.83퍼센트까지 올랐다. 다만 실제 사용자가 아니라 Claude Sonnet 4 모의 사용자를 썼다.

핵심 요약

  • 추천 목록에 나온 영화의 빈도와 순위를 이용해 불확실성을 계산하고, 현재 응답과 다음 사용자 답변이 그 값을 얼마나 줄였는지를 보상으로 삼는다.
  • INSPIRED는 학습 대화 801개와 시험 대화 99개, ReDial은 필터링 뒤 학습 8,631개와 시험 1,036개다. 모의 대화는 최대 5턴까지 진행한다.
  • 세 번 실행 평균에서 턴 엔트로피 DPO의 INSPIRED 모의 대화 적중률은 27.94퍼센트로 CollabLLM 보상의 26.60퍼센트보다 높았다. ReDial에서는 대화 전체 엔트로피 DPO가 32.83퍼센트로 30.03퍼센트보다 높았다.
  • ReDial에서 정답 영화에 도달한 평균은 2.74턴으로 CollabLLM DPO의 2.86턴보다 적었다. 그러나 실제 사람과의 대화 효율을 측정한 값은 아니다.
  • 평가는 자동 추천 지표와 LLM 모의 사용자에 의존한다. 추천 5개를 5번 뽑는 설정의 민감도도 검증하지 않았고, 직접 추천 Hit@1은 INSPIRED 3.32퍼센트와 ReDial 2.24퍼센트에 머물렀다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)