EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments
- 발행일
- 출처
- arXiv
- 논문 번호
- 567
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.05155
약 38,000시간의 에이전트-환경 상호작션을 분석해 환경 학습이 log-sigmoid 스케일링 법칙(R²=0.998)을 따름을 최초로 발견한다. 134개 실세계 태스크로 구성된 EdgeBench를 공개한다.
EdgeBench는 134개 실세계 태스크(과학·소프트웨어·최적화·전문 지식·형식 수학·게임)에서 약 38,000시간의 에이전트 환경 상호작용 데이터를 분석하여, 환경 학습 성능이 log-sigmoid 스케일링 법칙을 따름을 발견했다(R²=0.998). 프론티어 모델의 학습 속도가 약 3개월마다 2배로 향상되며, 연속 경험이 독립 재시작보다 우수함을 입증했다.
핵심 요약
- 환경 학습 평균 성능이 log-sigmoid 스케일링 법칙을 따름 (R²=0.998), 6개 태스크 패밀리 모두에서 안정적
- 134개 실세계 태스크: 각 12시간+ 연속 실행, 인간 전문가 평균 57.2시간 소요 대형 과제
- 프론티어 에이전트 학습 속도가 약 3개월마다 2배 향상 (2025년 9월 이후 모델 기준)
- 연속 경험 > 독립 재시작: 누적 경험이 장기 성능을 강하게 결정
- 이론: 잠재 태스크 그래프에서의 frontier expansion 과정으로 log-sigmoid 형태 도출
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.