유통 / 패션 전자상거래

Zalando: 장애 보고서 분석과 투자 우선순위 판단

기업
Zalando
국가
독일
도입 상태
운영
자료 공개
날짜 기준
자료 발표 시점. 도입 시작일과 다를 수 있음
근거 확인 방법
원문 본문 열람

업무 문제

Zalando는 장애가 끝나면 postmortem 문서를 남기고 사람이 읽어 배우는 방식을 써 왔다. 한 건을 제대로 읽는 데 15분에서 20분이 걸렸다. 한 사람이 집중해도 한 시간에 네 건 정도가 한계였다. 그동안 쌓인 아카이브 문서는 수천 건이라 팀을 넘나드는 반복 원인을 사람 힘만으로 찾기 어려웠다.

적용한 기술과 데이터

분석 절차를 네 단계로 나눴다. 요약, 기술 분류, 사건별 분석, 전체 패턴 추출 순서다. 입력은 사내에 쌓인 postmortem 아카이브 문서다. 분류 단계에서는 기술 목록을 함께 주고 문서에 직접 연결이 확인된 기술 이름만 돌려주게 제한했다. 처음에는 LM Studio에 올린 오픈소스 모델을 썼고 지금은 AWS Bedrock의 Claude Sonnet 4를 쓴다. 절차를 만드는 동안에는 출력 묶음을 100% 사람이 검수했고, 시스템이 자리를 잡은 뒤에는 묶음마다 10~20%를 무작위로 뽑아 검수한다.

성과

map-fold 구조를 쓰던 시기에 이미 연간 분석을 24시간 안에 끝낼 수 있게 됐다고 밝혔다. 최신 버전은 Claude Sonnet 4로 한 건을 약 30초에 처리한다고 설명했다. 분석에서 나온 통찰은 인프라 코드 자동 변경 검증으로 이어졌고, Zalando는 이 조치가 뒤이은 데이터스토어 장애의 25%를 막아 준다고 밝혔다. 반복되는 실패 유형으로는 자동 변경 검증 부재, 일관성 없는 변경 관리, 점진적 배포 부재, 트래픽 양 과소평가, 수요보다 늦은 증설을 꼽았다.

한계와 남은 과제

Zalando는 Claude Sonnet 4 같은 최신 모델에서도 표면 단서에 기댄 잘못된 원인 귀속이 약 10% 남는다고 밝혔다. GMV나 EBIT 손실 같은 수치를 postmortem에서 뽑아내는 정확도는 확보하지 못했다고 적었다.

출처

공개된 자료를 정리한 사례입니다. ATF Works 도입 고객의 결과가 아닙니다.

원문 보기 (새 탭에서 열림)