EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments

발행일
출처
arXiv
논문 번호
567
분야
LLMs / NLP
arXiv 번호
2607.05155

약 38,000시간의 에이전트-환경 상호작션을 분석해 환경 학습이 log-sigmoid 스케일링 법칙(R²=0.998)을 따름을 최초로 발견한다. 134개 실세계 태스크로 구성된 EdgeBench를 공개한다.

EdgeBench는 134개 실세계 태스크(과학·소프트웨어·최적화·전문 지식·형식 수학·게임)에서 약 38,000시간의 에이전트 환경 상호작용 데이터를 분석하여, 환경 학습 성능이 log-sigmoid 스케일링 법칙을 따름을 발견했다(R²=0.998). 프론티어 모델의 학습 속도가 약 3개월마다 2배로 향상되며, 연속 경험이 독립 재시작보다 우수함을 입증했다.

핵심 요약

  • 환경 학습 평균 성능이 log-sigmoid 스케일링 법칙을 따름 (R²=0.998), 6개 태스크 패밀리 모두에서 안정적
  • 134개 실세계 태스크: 각 12시간+ 연속 실행, 인간 전문가 평균 57.2시간 소요 대형 과제
  • 프론티어 에이전트 학습 속도가 약 3개월마다 2배 향상 (2025년 9월 이후 모델 기준)
  • 연속 경험 > 독립 재시작: 누적 경험이 장기 성능을 강하게 결정
  • 이론: 잠재 태스크 그래프에서의 frontier expansion 과정으로 log-sigmoid 형태 도출

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)