SRE サイトリライアビリティエンジニアリング ―Googleの信頼性を支えるエンジニアリングチーム
by Betsy Beyer, Chris Jones, Jennifer Petoff, Niall Richard Murphy, 澤田 武男, 関根 達夫, 細川 一茂, 矢吹 大輔, Sky株式会社 玉川 竜司
16章サービス障害の追跡
執筆:Gabe Krabbe
編集:Lisa Carey
信頼性を時間の経過と共に高めていくためには、ベースラインを決め、進歩を追跡できなければなりません。私たちのサービス障害追跡である「Outalator」は、それだけを行うツールです。Outalatorは、私たちのモニタリングシステムが送信するすべてのアラートを受動的に受け取るもので、私たちはそのデータに対してアノテーションを付けたり、グループ化や分析を行うことができます。
効率的にサービスを管理するためには、過去の問題からシステマティックに学ぶことが欠かせません。ポストモーテム(15章参照)は、個々のサービス障害に関する詳細な情報を提供してくれますが、それは回答の一部に過ぎません。ポストモーテムが書かれるのは大きなインパクトがあったインシデントだけなので、高頻度で広範囲に分布しているような問題であっても、個々のインパクトが小さいなら視界に入らないのです。同様に、ポストモーテムは1つのサービスや一連のサービス群の改善のための知見を提供する役には立ちますが、個々のケースとしては小さい効果しかないような改善の機会や、費用対効果に乏しいものの横断的に見れば大きいインパクトを持ちうるような改善の機会は見逃してしまうかもしれません†1。
また、以下のような質問をしてみることでも有益な情報が得られます。「このチームでは、オンコールのシフトごとにいくつのアラートを受けているか?」「この四半期における、アクション可能なアラートとアクション不可能なアラートの比率は?」 あるいは単純に「このチームが管理しているサービスの中で、最もトイルを生じさせているのはどれか?」
16.1 Escalator
Googleでは、SREに対するすべてのアラート通知 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access