SIA: Self Improving AI with Harness & Weight Updates
- 발행일
- 출처
- arXiv
- 논문 번호
- 268
- 분야
- AI / General
- arXiv 번호
- 2605.27276
Hexo Labs와 옥스퍼드 대학교의 연구진은 운영 스캐폴드와 기저 모델 가중치를 모두 반복적으로 갱신함으로써 AI 성능을 자율적으로 개선하는 시스템 SIA를 개발했다.
SIA는 과제용 에이전트의 도구·프롬프트·검색 절차 같은 하니스와 기저 언어 모델의 가중치를 하나의 피드백 에이전트가 번갈아 개선하는 체계다. 하니스만 고치는 방식과 가중치만 학습하는 방식을 분리하지 않고, 과제 검증 결과에 따라 두 종류의 업데이트를 모두 수행한다. 중국 법률 혐의 분류, H100 GPU 커널 최적화, 단일세포 RNA 잡음 제거의 세 영역에서 하니스와 가중치를 함께 갱신한 방식이 하니스 전용 반복보다 모두 우수했다. 이전 최고치와 비교해 LawBench는 25.1% 높았고, GPU 커널은 12.4% 빨랐으며, 잡음 제거 지표도 20.4% 개선됐다고 보고했다. 다만 두 최적화가 같은 고정 검증기를 함께 공략하므로 검증 점수에는 강하지만 하니스나 정책이 달라지면 취약한 결합형 굿하트 문제가 생길 수 있다.
핵심 요약
- SIA-H(Harness 전용): 에이전트는 분류 파이프라인을 구축해 50.0% 정확도에 도달했다. 그러나 프롬프트와 코드가 한계에 이르면서 성능이 정체되었다.
- SIA-W+H(Weights + Harness): 가중치 갱신을 추가하자 모델이 법률적 미묘함을 내재화하는 법을 학습했다. 정확도는 70.1%로 도약했으며, 이는 이전 최고 성능인 45.0%를 크게 상회하는 결과다.
- SIA-W+H: 이 시스템은 초기 베이스라인 대비 14.02배의 속도 향상을 달성했다. 여기서 가중치 갱신이 결정적이었는데, 모델이 공유 메모리 타일링과 레지스터 누산 같은 특정 H100 하드웨어 패턴을 학습했으며 이는 스캐폴드 반복만으로는 발견할 수 없는 것이었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.