Retrieval-augmented reasoning with lean language models
- 발행일
- 출처
- arXiv
- 논문 번호
- 077
- 분야
- Medical AI / RAG
- arXiv 번호
- 2508.11386
The Alan Turing Institute와 협력 기관 연구진은 경량 언어 모델을 활용한 검색 증강 추론 프레임워크를 고안하여, 도메인 특화 과제에서 GPT-4o 같은 프런티어 모델에 견줄 만한 조건 예측 정확도를 달성했다.
The Alan Turing Institute와 협력 기관 연구진은 경량 언어 모델을 활용한 검색 증강 추론 프레임워크를 고안하여, 도메인 특화 과제에서 GPT-4o 같은 프런티어 모델에 견줄 만한 조건 예측 정확도를 달성했다. 이 접근법은 로컬 및 프라이버시 보존 배포를 지원하며, 1.5B 파라미터 모델이 32B 비추론 베이스라인과 동등한 성능을 낼 수 있게 한다.
핵심 요약
- 최첨단 검색 증강 생성(RAG) 및 추론 시스템은 대형 외부 언어 모델에 의존하는데, 이는 민감한 데이터를 다루는 응용에서 프라이버시와 보안 위험을 초래한다.
- 대형 프런티어 언어 모델을 로컬에서 배포하고 구동하는 것은 높은 자원 요구로 인해 많은 조직에게 계산상 부담이 크다.
- 범용 언어 모델은 전문 도메인에서 깊고 검증 가능한 전문성을 결여하는 경우가 많아, 중요한 응용에서 부정확성이나 환각을 유발한다.
- 연구진은 추론 및 생성을 위한 효율적인 언어 모델 백본으로 1.5B부터 32B 파라미터에 이르는 Qwen2.5-Instruct 모델을 사용했다.
- 의미 임베딩, 벡터 데이터베이스, 그리고 관련 정보를 유지하면서 컨텍스트 길이를 관리하기 위해 문서 전체를 검색하고 사전 요약하는 새로운 전략을 사용하여 검색 시스템을 개발했다.
- 경량 언어 모델의 지도 미세조정을 감독하기 위해, 다양한 사용자 질의와 상세한 추론 궤적을 포함한 합성 도메인 특화 데이터를 고성능 모델(GPT-4o 및 DeepSeek-R1)로 생성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.