What is Missing from AI Post-Training AI: An Empirical Analysis
- 발행일
- 출처
- arXiv
- 논문 번호
- 957
- 분야
- AI / General
- arXiv 번호
- 2608.19072
LLM 에이전트가 LLM을 포스트트레이닝하는 'AI-for-AI' 실험에서, 에이전트는 실행은 잘하는데 전략을 스스로 재평가하지 못한다는 걸 실증적으로 밝힌 논문이다.
이 논문은 한마디로 'AI가 AI를 학습시키는 실험에서 에이전트의 진짜 병목이 뭔지'를 찾아낸 실증 연구다. 공개된 포스트트레이닝 궤적(7개 벤치마크·4개 모델·20가지 에이전트 구성)을 분석하니, 모든 에이전트가 코드를 한 줄 쓰기 전에 학습 전략을 이미 못박고 남은 예산 전부를 그 전략 안에서의 국소 조정에 썼다. 같은 에이전트는 서로 다른 과제에서도 비슷한 전략으로 수렴하는 반면 다른 에이전트는 다른 기본값에 묶여 있어서, 전략이 과제가 아니라 에이전트의 사전 지식을 반영함을 보였다. 경험(실험 일지+스킬 라이브러리+평가 에이전트)을 넣으니 실행은 GSM8K +12.6점, HumanEval +40.8점 올랐지만 전략은 그대로였고, 사람이 전략을 고쳐줘도 학습이 시작되면 다시 국소 루프에 빠졌으며, 추론 토큰을 2~8배 늘려도 가장 어려운 과제에선 이득이 거의 없었다. 결론은 빠진 게 경험·지도·추론 컴퓨트가 아니라 '실행 도중에 전략을 자발적으로 재평가하는 메커니즘'이라는 것이다.
핵심 요약
- 실행 능력(고른 전략 안에서의 미세조정)과 전략 능력(증거가 쌓이면 상위 판단 자체를 바꾸기)을 분리하고, 병목은 후자라고 규정했다.
- 훈련 전략은 첫 순간에 고정되고 이후 예산은 전부 국소 조정에 소모된다. 10시간 이상 '틀린 전략 안에서 효율적으로' 반복할 수 있다.
- 전략 고정은 과제가 아니라 에이전트 사전 지식의 반영이다. 같은 에이전트는 과제가 달라도 비슷한 전략을, 다른 에이전트는 같은 과제에서 다른 전략을 골랐다.
- 경험 스캐폴딩(실험 일지+스킬 라이브러리+평가 에이전트)은 실행을 GSM8K +12.6점, HumanEval +40.8점 올리지만 전략은 바꾸지 못했다.
- 사람의 전략 수정은 학습 시작 전 짧은 창에서만 통하고, 시작 후엔 국소 루프로 회귀한다. 추론 컴퓨트를 2~8배 늘려도 최난과제에선 거의 무효했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.