WHALE: A Simple Recipe for Joint Harness-Weight Optimization

발행일
출처
arXiv
논문 번호
1059
분야
Machine Learning
arXiv 번호
2609.00196

모델 가중치 학습과 실행 하네스 코드 탐색을 짧게 번갈아 수행해, 한쪽만 개선할 때 생기는 병목을 줄이는 에이전트 공동 최적화 방법이다.

이 논문은 AI 에이전트의 성능이 모델 가중치뿐 아니라 도구 연결, 문맥 관리, 오류 처리와 실행 흐름을 맡는 하네스 코드에도 함께 좌우된다는 문제에서 출발한다. WHALE은 현재 하네스에서 모델을 학습한 뒤, 갱신된 모델에 더 잘 맞는 하네스를 찾는 두 단계를 반복한다. 연구진은 온라인 거부 샘플링 미세조정과 Meta-Harness를 결합하고, 고정된 단계 길이 또는 학습 신호가 좋아지지 않을 때 전환하는 방식으로 두 단계의 시점을 정했다. Qwen3.5-2B와 4B를 검색 질의응답, 수학 추론, 체스 퍼즐에 적용한 결과, 가중치만 또는 하네스만 최적화한 기준과 프롬프트 중심 공동 학습보다 높은 정확도를 보였다. 다만 실험이 소형 모델 세 종류의 과제에 한정됐고, 보고된 롤아웃 비용 비교에는 하네스 후보를 만드는 계산량이 포함되지 않았다.

핵심 요약

  • 현재 하네스를 고정한 온라인 거부 샘플링 미세조정과 갱신된 모델을 고정한 Meta-Harness 코드 탐색을 번갈아 수행한다.
  • Qwen3.5-2B와 4B를 검색 질의응답, 수학 추론, 체스 퍼즐에 평가해 단일 요소 기준보다 7.67~24.38%포인트, 프롬프트만 바꾸는 FST보다 4.15~13.00%포인트 높은 최고 정확도를 기록했다.
  • 검색 과제는 하네스가 주된 병목이었지만 수학 과제는 먼저 가중치를 갱신해야 같은 하네스 탐색이 효과를 내어, 과제마다 병목 위치가 달라짐을 보였다.
  • 작은 갱신을 여러 번 교차하면 가중치를 모두 학습한 뒤 하네스를 한 번 찾는 단계식 방식보다 정확도와 롤아웃 효율이 좋아져, 에이전트 학습 파이프라인을 하나의 공동 최적화 문제로 설계할 근거를 준다.
  • 중요한 한계는 Qwen3.5-2B와 4B 및 세 과제에만 검증됐고, 롤아웃 비용 비교에서 하네스 제안 모델의 계산량을 제외했다는 점이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)