Toward Generalist Autonomous Research via Hypothesis-Tree Refinement

발행일
출처
arXiv
논문 번호
392
분야
LLMs / NLP
arXiv 번호
2606.11926

가설 트리 정제(HTR) 기반의 자율 연구 프레임워크 Arbor를 제안해, 에이전트가 장기적으로 누적되는 연구를 수행하게 한다.

과학적 발견의 핵심인 탐색-실험-추상화 루프를 AI 에이전트가 자율적으로 수행하도록 설계된 Arbor 프레임워크를 제안한다. 장기 코디네이터와 단기 실행자, 그리고 가설-산출물-증거-인사이트를 연결하는 Hypothesis Tree Refinement(HTR)가 핵심이다. 모델 훈련, 하니스 엔지니어링, 데이터 합성 등 6개 실제 연구 과제에서 Codex와 Claude Code 대비 평균 2.5배 이상의 held-out 개선을 달성했으며, MLE-Bench Lite에서 86.36% Any Medal을 기록했다.

핵심 요약

  • Autonomous Optimization(AO) 설정: 인간의 단계적 감독 없이 초기 산출물을 반복 실험으로 개선하는 과제 정의
  • 가설 트리에 각 노드가 가설-산출물 버전-실험 증거-정제된 인사이트를 바인딩하여 누적 연구 상태 구현
  • 코디네이터-실행자 분리: 전역 전략은 코디네이터, 개별 실험은 격리된 worktree에서 실행자가 담당
  • 6개 실제 연구 과제(모델 훈련/하니스/데이터 합성)에서 Codex, Claude Code 대비 2.5x+ 평균 상대 이익
  • MLE-Bench Lite에서 GPT-5.5 기반 86.36% Any Medal 달성, ablation에서 HTR+인사이트 전파가 핵심임 확인
  • BrowseComp 최적화 하니스가 미가시 search-agent 과제로 전이되는 등 일반화 능력 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)