LLM-Based Automated Diagnosis Of Integration Test Failures At Google
- 발행일
- 출처
- arXiv
- 논문 번호
- 148
- 분야
- Agents / Coding / Production
- arXiv 번호
- 2604.12108
Google의 연구진은 방대하고 이질적인 로그 데이터를 처리하여 복잡한 통합 테스트 실패의 근본 원인을 자동으로 식별하는 LLM 기반 도구 Auto-Diagnose를 개발했다.
Google의 연구진은 방대하고 이질적인 로그 데이터를 처리하여 복잡한 통합 테스트 실패의 근본 원인을 자동으로 식별하는 LLM 기반 도구 Auto-Diagnose를 개발했다. Google 전사에 배포된 이 도구는 전문가 평가에서 90.14%의 정확도를 달성했으며, 디버깅 시간을 크게 단축하여 사내 개발자 도구 중 최상위권으로 평가받았다.
핵심 요약
- 통합 테스트 실패의 진단은 흔히 수 시간에서 수일이 걸릴 만큼 매우 시간 소모적이며, 개발자에게 상당한 인지적 부담을 준다.
- 현대의 분산 시스템은 다수의 분산되고 동적으로 이름이 부여되는 소스로부터 방대한 양의 로그(실패당 평균 11,058줄, 26개 파일)를 생성하여, 수작업 선별을 어렵게 만든다.
- 로그는 흔히 반정형이고 이질적이며 신호 대 잡음 비가 낮아, 실제 근본 원인과 무관한 다수의 경고나 오류가 핵심 정보를 가린다.
- 통합 테스트 실패를 감지하면 테스트 드라이버와 피시험 시스템(SUT) 구성요소에서 로그를 수집하고 통합하는, LLM 중심의 자동화 파이프라인 Auto-Diagnose를 구현했다.
- 단계별 안내 추론, 추측을 방지하는 엄격한 부정 제약, 진단을 위한 정밀한 출력 형식을 포함하도록 정교하게 설계된 프롬프트 템플릿과 함께 Gemini 2.5 Flash를 활용했다.
- LLM 출력을 가독성 있는 마크다운으로 후처리하고 식별된 관련 로그 줄을 클릭 가능하게 만들어, 진단 기능을 Google의 사내 코드 리뷰 시스템 Critique에 직접 통합함으로써 매끄러운 개발자 워크플로를 구현했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.