AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
- 발행일
- 출처
- arXiv
- 논문 번호
- 886
- 분야
- Machine Learning
- arXiv 번호
- 2608.12307
이 논문은 실험한 마음 이론 문제에서, 강한 모델이 실행 코드와 규칙을 포함한 하네스를 만들면 약한 모델의 가중치를 다시 학습하지 않고도 성능을 크게 높일 수 있음을 보였다.
이 논문은 한마디로 강한 모델의 능력을 약한 모델에 옮길 때 재학습 대신 실행 환경을 개선하는 방법을 연구했다. 하네스는 프롬프트, 문제 분류 규칙, 계산 코드와 답변 형식 검사 등을 묶은 실행 절차다. 강한 제작 모델은 규칙과 호출 예시를 확인하고, 전체 평가 규모의 5%에 해당하는 별도 검증 표본으로 하네스를 반복해서 고친 뒤 완성된 하네스를 숨겨진 시험에 적용한다. 성능 향상의 주된 이유는 더 오래 생각하게 만든 것이 아니라 불안정한 계산을 코드와 규칙으로 옮긴 데 있었다.
핵심 요약
- 대상 모델의 가중치를 바꾸지 않고 프롬프트, 문제별 처리 규칙, 계산 코드와 답변 형식 검사를 조합한다.
- 숨겨진 시험 문항은 마음 이론 문제 4종의 3,900개였고, 하네스 개선에는 별도의 검증 문항 195개가 제공됐다.
- GPT-5.4-mini의 기본 평균 점수는 0.488이었고, 자동 생성 하네스를 적용한 전체 평균은 0.763, 최고 점수는 0.912였다.
- 같은 입력이면 같은 결과를 내는 코드와 문제별 경로 선택, 엄격한 출력 형식이 긴 추론이나 추가 표본 생성보다 더 큰 효과를 냈다.
- 약한 대상 모델에서 개선 폭이 컸지만 강한 대상 모델에서는 일부 성능 저하도 나타났으며, 실험 범위는 마음 이론 문제에 한정됐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.