Apodex 1.1: Scaling Agentic Intelligence for Complex Work

발행일
출처
arXiv
논문 번호
988
분야
AI / General
arXiv 번호
2608.23283

이 논문은 AI가 책상에 앉아 실제 일을 하는 '실무 능력'을 키우기 위해, 다양한 검증형 작업 환경과 여러 에이전트의 협업 조율을 동시에 훈련시킨 일반 업무 모델(Apodex 1.1)+실행 시스템(AgentOS)을 만들었다.

이 논문은 한마디로 AI를 '대화 상대'가 아니라 '실무자'로 만드는 시스템이다. 저자들은 두 가지를 동시에 키웠다. 첫째, 파일·검색·코드 같은 다양한 작업 환경에서 스스로 검증하며 작업하는 훈련(환경 스케일링). 둘째, 큰 문제를 쪼개 여러 에이전트에게 맡기고 비동기 결과를 합치는 조율 능력(에이전트 조율 스케일링). 그 결과 금융 실무(FrontierFinance 54.3점)와 과학 연구(FrontierScience-Research 63.3점)에서는 논문이 제시한 비교 표에서 가장 높은 값을 기록했다. 반면 업무 가치 산출(GDPVal)에서는 78.8점을 받았고, 논문은 이를 '경쟁력 있는 성능'이라고 적었으며 같은 표에서 Claude-Opus-5가 89.4점으로 더 높다.

핵심 요약

  • 파일·검색·코드 등 다양한 검증 가능한 작업 환경을 활용해 모델의 '일하는 능력'을 훈련시켰다.
  • 문제를 쪼개고→위임하고→비동기 결과를 합치고→다시 계획하는 멀티에이전트 조율을 별도의 훈련 축으로 다뤘다.
  • 금융 실무 FrontierFinance 54.3점, 과학 연구 FrontierScience-Research 63.3점, 업무 산출물 GDPVal 78.8점을 기록해 논문이 말한 선두 성능 구간에 들었다.
  • 반면 자체 벤치마크 FrontierResearchBench의 고난도 과학 워크플로에서는 통과율이 12.4%에 그쳐 앞선 시스템들에 뒤졌고, 논문도 이런 작업을 끝까지 해내는 일은 평가한 모든 시스템에 여전히 어렵다고 적었다.
  • 35B 파라미터 Mini 버전이 로컬에 올릴 수 있는 형태로도 실무 수행 능력을 상당 부분 지켜, 작은 규모로 현장에 배포할 길을 열었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)