ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 293
- 분야
- AI / General
- arXiv 번호
- 2606.02568
임상 진료는 나열된 선택지 중에서 답을 고르는 것이 아니다. 의사는 이질적인 정보를 점진적으로 수집하며 불확실성 속에서 순차적이고 되돌릴 수 없는 결정을 내린다.
ClinEnv는 실제 입원 기록을 여러 의사결정 단계로 구성해 대규모 언어 모델을 주치의처럼 평가하는 상호작용형 벤치마크다. 모델은 각 단계에서 네 종류의 전문 에이전트에게 필요한 정보를 직접 요청한 뒤 약물, 시술, 진단을 결정해야 하며, 결정 내용과 정보 수집 과정이 함께 채점된다. 일곱 모델 중 최고 모델도 의사결정 F1이 0.31에 그쳤고, 퇴원 진단은 비교적 잘 찾았지만 관리 행동은 훨씬 어려워했다. 사례가 진행될수록 불필요한 질의를 반복하는 현상도 나타나 최종 답만 보는 평가로는 드러나지 않는 정보 수집 약점을 보여줬다. 다만 단일 미국 의료기관의 실제 기록을 정답으로 삼기 때문에 다른 합리적 진료가 오답 처리될 수 있고, 다른 국가·언어·의료 체계로의 일반화도 아직 확인되지 않았다.
핵심 요약
- 정적 벤치마크는 이를 검증할 수 없으며, 기존의 상호작용형 의료 벤치마크는 각각 적어도 한 가지 측면에서 타협한다.
- 이 논문은 종단적 입원 시뮬레이션(Longitudinal Inpatient Simulation)이라 명명한 패러다임 하에서 실제 입원 사례에 대해 LLM을 주치의로서 평가하는 상호작용형 벤치마크인 ClinEnv를 제시한다.
- 각 사례는 순서가 있는 결정 단계의 시퀀스로 자동 구성된다. 모든 단계에서 모델은 약물, 시술, 진단을 확정하기 전에 4개의 전문화된 에이전트에게 능동적으로 질의해야 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.