Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

발행일
출처
arXiv
논문 번호
521
분야
LLMs / NLP
arXiv 번호
2606.30616

35B MoE 모델로 agent horizon을 확장하여 1T 파라미터 모델과 맞먹는 성능을 달성한 Agents-A1을 소개한다. 지식-행동 인프라와 다중 교사 온정책 증류가 핵심이다.

Agents-A1은 35B Mixture-of-Experts 모델로, agent horizon(평균 45K 토큰 궤적)을 확장하여 1T 파라미터 모델 수준의 성능을 달성한다. Knowledge-Action Graph(KAG) 기반의 장기 궤적 인프라를 구축하고, 6개 이기종 도메인(검색, 과학, 엔지니어링, 도구, 지시 수행)에 대해 3단계 학습(전 도메인 SFT → 도메인별 교사 → 다중 교사 온정책 증류)을 수행한다. SEAL-0, IFBench, HiPhO, FrontierScience-Olympiad 등에서 Kimi-K2.6, DeepSeek-V4-pro 등 1T 모델을 능가하거나 필적하는 결과를 보여준다.

핵심 요약

  • 35B MoE로 파라미터가 아닌 agent horizon 확장을 통한 성능 향상 경로 제시
  • Knowledge-Action Graph(KAG): 증거·행동·관찰·검증 결과를 연결된 객체로 저장하는 장기 궤적 인프라
  • 3단계 학습: 전 도메인 SFT → 도메인별 교사 RL → domain-routed 다중 교사 온정책 증류
  • 평균 45K 토큰 길이의 agent 궤적 생성, 6개 이기종 도메인 통합
  • SEAL-0(56.4), IFBench(80.6), FrontierScience-Olympiad(79.0) 등에서 1T 모델 능가
  • Salient Vocabulary Alignment로 도메인 간 추론 패턴 충돌 완화

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)