Coding Agents are Effective Long-Context Processors
- 발행일
- 출처
- arXiv
- 논문 번호
- 132
- 분야
- Code Agents / Long Context
- arXiv 번호
- 2603.20432
이 논문은 장기 컨텍스트 추론을 실행 가능한 파일시스템 탐색 문제로 재구성하여, 코딩 에이전트가 고유의 검색과 스크립팅, 저장소 탐색 습관을 사용함으로써 더 큰 컨텍스트 윈도우와 고정된 RAG를 능가할 수 있음을 보여준다.
이 연구는 장기 컨텍스트 처리를 불투명한 어텐션 밖으로 빼내어 기성 코딩 에이전트가 수행하는 명시적 행동으로 옮길 수 있는지를 묻는다. 저자들은 문서나 코퍼스를 파일과 디렉터리로 패키징하고, Codex와 Claude Code 같은 에이전트에게 질의와 경로만 주며, 과제 특화 미세조정 없이 grep과 ripgrep, sed, Python 스크립트, 중간 파일, 반복 검색을 사용하게 한다. BrowseComp-Plus, LongBench-v2, Oolong, Natural Questions 전반에서 코딩 에이전트는 기존에 발표된 시스템보다 평균 17.3% 향상되었으며, BrowseComp-Plus에서 88.5%, 3조 토큰 규모의 NQ 코퍼스에서 56.0 EM을 포함해 다섯 개 중 네 개 벤치마크에서 최고 결과를 세웠다. 절제 실험은 계층적 폴더 구조가 단일 JSON 파일보다 더 도움이 되는 반면, BM25나 밀집 검색기를 추가하면 에이전트가 철저한 터미널 탐색을 하는 대신 불완전한 상위 k개 검색을 과신하게 만들어 때때로 해가 될 수 있음을 보여준다.
핵심 요약
- 방법은 다음과 같다. 긴 문서와 대규모 코퍼스를 탐색 가능한 파일과 디렉터리로 표현한 뒤, 코딩 에이전트가 grep, sed, Python 집계, 노트 파일과 같은 실행 가능한 연산을 선택하게 한다.
- 핵심 아이디어는 장기 컨텍스트 추론이 환경 상호작용이 된다는 것이다. 모델은 더 이상 모든 것을 잠재 어텐션이나 단일 검색 스니펫으로 압축할 필요가 없다.
- 결과로, 기존 최고 발표 시스템 대비 평균 17.3% 향상되었으며, 다섯 개 중 네 개 벤치마크에서 SOTA를 달성하고 188K 토큰 컨텍스트에서 3조 토큰 위키피디아 코퍼스까지 강한 확장성을 보였다.
- 한계이자 시사점으로, 이 접근법은 에이전트의 도구 역량과 데이터 조직화에 의존한다. 순진하게 검색기를 추가하면 유용한 탐색을 억제할 수 있으므로, 향후 시스템은 파일시스템 검색을 대체하지 않고 보완하는 검색을 필요로 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.