DeepCode: Open Agentic Coding

발행일
출처
arXiv
논문 번호
095
분야
Code Generation / Agents
arXiv 번호
2512.07921

DeepCode는 과학 논문으로부터 실행 가능한 코드 저장소를 자율적으로 생성하는 다단계 에이전트 프레임워크를 제시하며, PaperBench Code-Dev 벤치마크에서 73.5%의 재현 점수를 달성하고 박사급 인간 전문가의 성능을 능가한다.

DeepCode는 과학 논문으로부터 실행 가능한 코드 저장소를 자율적으로 생성하는 다단계 에이전트 프레임워크를 제시하며, PaperBench Code-Dev 벤치마크에서 73.5%의 재현 점수를 달성하고 박사급 인간 전문가의 성능을 능가한다.

핵심 요약

  • 기존 LLM 기반 코딩 에이전트는 길고 멀티모달한 과학 논문을 기능적 코드 저장소로 변환할 때 정보 과부하와 컨텍스트 병목에 어려움을 겪는다.
  • 흔한 실패 양상으로는 단편화된 사양의 보존, 모듈 전반의 전역 일관성 유지, 불충분하게 명시된 설계의 완성, 종단 간 실행 충실성 확보의 어려움이 있다.
  • 기존의 범용 및 특화된 과학 코드 에이전트는 자율 소프트웨어 공학 과제에서 재현 점수가 인간 전문가에 한참 미치지 못해 성공이 제한적이었다.
  • DeepCode는 다단계 프레임워크를 채택한다. Blueprint Generation은 원시 문서를 구조화된 사양으로 정제하여 정보 과부하를 완화한다.
  • Code Generation은 진화하는 코드베이스의 상태 유지형 구조적 인덱싱을 위해 CodeMem을 활용하여 전역 일관성을 보장하고, 고품질 코드 코퍼스로부터 조건부 지식 주입을 위해 CodeRAG를 사용한다.
  • Automated Verification and Refinement는 정적 분석과 샌드박스 실행 피드백을 통합해 폐쇄 루프 오류 수정을 수행함으로써, 합성된 저장소의 기능적 충실성을 보장한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)