From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution

발행일
출처
arXiv
논문 번호
803
분야
AI / General
arXiv 번호
2608.02163

간단한 질문을 여러 라운드에 걸쳐 어려운 딥리서치 과제로 자동 진화시켜, 500개 과제와 근거에 묶인 채점 기준을 사람 손 없이 만든 벤치마크다.

딥리서치 평가는 전문가가 직접 과제와 채점 기준을 써야 해서 비싸고, 완전 자동 생성은 검증 가능성이 약하다는 문제가 있다. 저자들은 Explorer, Formalizer, Challenger 세 역할이 도는 반복 파이프라인으로 위키피디아 QA 말뭉치의 단순 질문을 라운드마다 더 어려운 딥리서치 과제로 키운다. 과제는 원자 단위 연구 단계의 방향성 비순환 그래프(DAG)로 표현되고, 각 노드에서 검증 가능한 체크포인트와 채점 기준이 함께 자란다. 그 결과 31개 주제, 10개 대분류, 3가지 질의 형태를 가진 500개 과제 벤치마크가 만들어졌다. 실험에서 모델별 능력 차이가 뚜렷하게 갈렸고, 자동 생성 채점 기준이 사람 평가와 높은 상관을 보였다.

핵심 요약

  • 벤치마크는 딥리서치 과제 500개로 구성되고 31개 주제와 10개 대분류를 덮으며, 질의 형태 3종으로 서로 다른 능력을 나눠 본다.
  • 구축 루프는 Explorer가 실제 환경에서 과제를 풀고, Formalizer가 그 결과를 DAG와 채점 체크포인트로 정리하고, Challenger가 아직 안 쓴 단서로 다음 라운드 질의를 만드는 식으로 돈다.
  • 라운드가 진행되면 평균 DAG 깊이가 1라운드 2.5에서 5라운드 5.2로 빠르게 늘고 이후 약 7.0으로 완만해지며, 노드 수는 4.6에서 25.2로, 체크포인트는 13.6에서 123.2로, Explorer 도구 호출은 3.9회에서 23.3회로 늘어난다. 평균 진화 라운드는 14.19다.
  • 난이도가 실제로 올라간다. 정보를 넉넉히 주는 질의를 뺀 나머지 두 질의 형태에서 라운드 평균 점수가 약 0.93과 0.95에서 약 0.29와 0.40까지 떨어졌다. 그런데도 모델 간 상대 순위는 대부분 라운드에서 유지된다.
  • 도구를 빼면 열 개 모델 전부 점수가 떨어진다. 전체 점수가 평균 0.14 하락하고 증거형과 분석형 체크포인트에서 각각 평균 0.07 떨어져, 과제가 사전학습에 잘 없는 롱테일 정보를 요구한다는 뜻이다.
  • 채점 안정성도 확인했다. 사람이 검수한 100개 과제에서 같은 모델로 반복 채점하든 다른 모델로 채점하든 사람 평가와의 피어슨 상관이 0.884에서 0.916 사이로 높게 나왔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)