小売 / ファッション電子商取引

Zalando:障害報告書の分析と投資の優先順位の判断

企業
Zalando
国
ドイツ
導入状況
運用中
資料公開
日付の基準
資料が公開された時点。導入を開始した日とは異なる場合がある。
根拠の確認方法
原文の本文を閲覧

業務課題

Zalandoは障害が終わるとpostmortemの文書を残し、人が読んで学ぶやり方を使ってきた。一件をきちんと読むのに15分から20分かかった。一人が集中しても一時間に四件ほどが限界だった。その間に積み上がった保管文書は数千件で、チームをまたぐ繰り返しの原因を人の力だけで探すのは難しかった。

使った技術とデータ

分析の手順を四つの段階に分けた。要約、技術の分類、事案ごとの分析、全体の型の抽出の順である。入力は社内に積み上がったpostmortemの保管文書である。分類の段階では技術の一覧を一緒に渡し、文書に直接の結び付きが確かめられた技術の名前だけを返すよう制限した。最初はLM Studioに載せたオープンソースのモデルを使い、今はAWS BedrockのClaude Sonnet 4を使う。手順を作っている間は出力の束を100%人が検収し、システムが落ち着いたあとは束ごとに10から20%を無作為に抜き出して検収する。

成果

map-foldの構造を使っていた時期に、すでに年間の分析を24時間のうちに終えられるようになったと述べた。最新の版はClaude Sonnet 4で一件を約30秒で処理すると説明した。分析から出た洞察はインフラのコードの自動変更検証につながり、Zalandoはこの措置が後続のデータストアの障害の25%を防ぐと述べた。繰り返される失敗の型としては、自動の変更検証の不在、一貫しない変更管理、段階的な配布の不在、トラフィック量の過小評価、需要より遅い増設を挙げた。

限界と残る課題

Zalandoは、Claude Sonnet 4のような最新のモデルでも、表面の手がかりに頼った誤った原因の帰属が約10%残ると述べた。GMVやEBITの損失のような数値をpostmortemから取り出す精度は確保できなかったと記した。

出典

公開資料をまとめた事例です。ATF Works導入企業の成果ではありません。

原文を読む (新しいタブで開きます)