Long Context vs. RAG for LLMs: An Evaluation and Revisits

발행일
출처
arXiv
논문 번호
012
분야
RAG / Long Context
arXiv 번호
2501.01880

이 논문은 LC 대 RAG 논쟁을 일률적 주장에서 벗어나게 하고, 데이터셋 구성, 컨텍스트 관련성, 검색 설계가 결론을 뒤집을 수 있음을 보여주기 때문에 유용하다.

이 논문은 긴 컨텍스트 LLM이 RAG를 대체할 수 있는지에 대한 상충하는 주장을 재검토한 다음, 필터링된 QA 데이터, 더 강력한 검색기, 더 큰 평가 세트로 비교를 재구성한다. 저자들은 파라미터 지식만으로 답할 수 있는 질문을 제거하고, 벤치마크를 12개 데이터셋에 걸쳐 19,000개 이상의 질문으로 확장하며, 먼저 강력한 RAG 검색기를 탐색하는데, 여기서 요약 기반 RAPTOR가 청크 기반 대안을 능가한다. 주요 비교에서 LC는 전반적으로 RAG보다 높은 점수를 받으며, 특히 위키피디아 스타일 및 일관된 이야기 컨텍스트와 사실 탐색 질문에서 우수한 반면, RAG는 단편적이거나 대화형 정보에서 여전히 더 낫고 LC가 놓치는 약 1,300개 질문에 답한다. 핵심 시사점은 LC와 RAG가 상호 교환 가능하지 않다는 것이다. 현실적인 컨텍스트 구조와 벤치마크 구성이 결과를 크게 좌우하며, 외부 지식 시스템에는 하이브리드 설계가 필요할 가능성이 높다.

핵심 요약

  • 방법으로 GPT-4o와 엄격한 정확 일치 검사를 사용하여 외부 컨텍스트 없이 풀 수 있는 질문을 걸러낸 다음, 제공된 문서가 실제로 필요한 경우만 평가한다.
  • 검색기 연구에서는 BM25, Contriever, OpenAI text-embedding-3-small, LlamaIndex 스타일 색인 검색, RAPTOR를 비교한다. RAPTOR가 약 38.5%의 정답률로 가장 강력한 RAG 구성이다.
  • 결과적으로 LC는 약 56.3%의 정확 일치 정답률에 도달하여 전반적으로 RAG의 49.0%를 능가하며, 위키피디아 및 이야기 출처와 누가·어디서·어느 것 형식의 사실 질문에서 명확한 우위를 보인다.
  • 절충 측면에서 RAG는 단편적이고 자연스럽게 분할되며 대화 기반인 컨텍스트에서 잘 작동하고 LC가 실패하는 평가 질문의 약 10%를 고유하게 해결하므로 한물간 것이 아니다.
  • 평가 교훈은 무관한 구절을 이어 붙여 만든 합성 긴 컨텍스트가 RAG 전처리와 유사하여 비교를 편향시킬 수 있으므로, 컨텍스트 관련성을 벤치마크 변수로 다루어야 한다는 것이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)