Apodex 1.1: Scaling Agentic Intelligence for Complex Work
- 발행일
- 출처
- arXiv
- 논문 번호
- 988
- 분야
- AI / General
- arXiv 번호
- 2608.23283
이 논문은 AI가 책상에 앉아 실제 일을 하는 '실무 능력'을 키우기 위해, 다양한 검증형 작업 환경과 여러 에이전트의 협업 조율을 동시에 훈련시킨 일반 업무 모델(Apodex 1.1)+실행 시스템(AgentOS)을 만들었다.
이 논문은 한마디로 AI를 '대화 상대'가 아니라 '실무자'로 만드는 시스템이다. 저자들은 두 가지를 동시에 키웠다. 첫째, 파일·검색·코드 같은 다양한 작업 환경에서 스스로 검증하며 작업하는 훈련(환경 스케일링). 둘째, 큰 문제를 쪼개 여러 에이전트에게 맡기고 비동기 결과를 합치는 조율 능력(에이전트 조율 스케일링). 그 결과 금융 실무(FrontierFinance 54.3점)와 과학 연구(FrontierScience-Research 63.3점)에서는 논문이 제시한 비교 표에서 가장 높은 값을 기록했다. 반면 업무 가치 산출(GDPVal)에서는 78.8점을 받았고, 논문은 이를 '경쟁력 있는 성능'이라고 적었으며 같은 표에서 Claude-Opus-5가 89.4점으로 더 높다.
핵심 요약
- 파일·검색·코드 등 다양한 검증 가능한 작업 환경을 활용해 모델의 '일하는 능력'을 훈련시켰다.
- 문제를 쪼개고→위임하고→비동기 결과를 합치고→다시 계획하는 멀티에이전트 조율을 별도의 훈련 축으로 다뤘다.
- 금융 실무 FrontierFinance 54.3점, 과학 연구 FrontierScience-Research 63.3점, 업무 산출물 GDPVal 78.8점을 기록해 논문이 말한 선두 성능 구간에 들었다.
- 반면 자체 벤치마크 FrontierResearchBench의 고난도 과학 워크플로에서는 통과율이 12.4%에 그쳐 앞선 시스템들에 뒤졌고, 논문도 이런 작업을 끝까지 해내는 일은 평가한 모든 시스템에 여전히 어렵다고 적었다.
- 35B 파라미터 Mini 버전이 로컬에 올릴 수 있는 형태로도 실무 수행 능력을 상당 부분 지켜, 작은 규모로 현장에 배포할 길을 열었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.