CompanionBench: A Theory-Anchored, Real-World-Grounded Benchmark for AI Emotional Companionship
- 발행일
- 출처
- arXiv
- 논문 번호
- 798
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.02046
AI 감정 동반자를 이론 기반 10개 능력과 자기개방 관문이라는 두 축으로 재는 중국어 영어 이중 벤치마크 CompanionBench를 만들고, 모델 28개를 평가했다.
기존 동반자 평가는 사람이 지어낸 시나리오와 프롬프트로 흉내 낸 가상 사용자를 쓰고, 공감을 한 점수로 뭉뚱그리며, 심사 모델이 같은 계열을 편애하는 문제를 방치했다. 저자들은 심리학과 상담 이론 25편에서 뽑은 10개 능력 척도와, 실제 대화 자료로 학습시킨 사용자 시뮬레이터를 결합한 대화형 벤치마크 CompanionBench를 제안했다. 시뮬레이터에는 숨겨진 자기개방 관문이 있어서 상대 에이전트의 행동에 따라 대화 경로가 갈라지고, 이 관문 통과 여부가 주관 평가와 별개인 두 번째 결정론적 축이 된다. 심사에는 계열이 다른 모델 여러 개를 쓰고, 문항반응이론 모형으로 에이전트 실력과 심사자 엄격도를 분리한다. 모델 28개를 중국어와 영어 조건에서 평가한 결과, 겉으로 드러나는 해악보다 따뜻함으로 알맹이를 대신하는 실패가 지배적이었고 역할극 특화 모델이 바닥권에 몰렸다.
핵심 요약
- 능력 체계는 이론 25편에서 뽑은 10개 능력을 1점에서 10점 척도로 재며, 하위 항목이 총 42개다. 여기에 심각도 3단계로 나눈 18개 나쁜 패턴 목록을 역방향 층으로 얹었다.
- 선행 연구가 점수로 매기지 않던 4개 능력을 새로 넣었다. 모호함을 견디기, 자기대상 반응성, 긍정 공명, 눈높이에 맞춘 도전이다.
- 두 번째 축은 자기개방 관문 재생이다. 개방을 얼마나 자주 얻어냈는지와 얼마나 깊이 갔는지를 재고, 얻지 않은 개방을 가져갔는지도 따로 센다.
- 재현성이 높다. 독립 재실행 기준 첫 번째 축(10개 능력 점수) 순위의 스피어만 상관은 중국어 0.996, 영어 0.953이고, 10개 능력 중 8개가 0.93 이상이다. 가장 낮은 것은 긍정 공명 0.829와 눈높이 도전 0.863이다.
- 관문이 실제로 에이전트 행동을 따라간다는 증거로, 개방을 얻어낸 비율과 이르게 개방해 버린 비율이 강한 음의 상관을 보였다. 피어슨 상관이 영어 -0.938, 중국어 -0.979다.
- 28개 모델 리더보드에서 영어 기준 gpt-5.5가 문항반응이론 점수 8.27로 1위, 최하위 doubao-char-251128이 4.28이다. 역할극 특화 3개 모델은 바닥권이며, 부족분이 가장 큰 능력이 모호함 견디기와 눈높이 도전과 인정하기였다.
- 따뜻함과 알맹이가 갈린다는 것을 수치로 보였다. claude-haiku-4-5는 1차 점수 0.780에서 금지선 위반 반영 후 0.548로 떨어졌고, 최하위 모델은 0.395에서 0.017까지 떨어졌다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.