インシデント対応の「経験値」と「勘」はどこで育つのか
第2回の今回は、AIエージェントが一次調査を担う中で、インシデント対応の判断を支える経験をどう意図的に確保するかについて解説します。
6:30
はじめに
こんにちは。ソフトウェアエンジニアの髙石です。「SRE Kaigi 2025」で「どうやればインシデント対応能力を鍛えられるのか?」というテーマで登壇し*1、その縁で本連載に記事を寄稿することとなりました。
インシデント対応の手法は書籍やWebなどから容易に手に入ります。しかし、読んだだけでスムーズに対応できるようになるとは限りません。また、本記事が公開される2026年9月時点では、AIエージェントをインシデント対応に活かす取り組みが広がっています。これによりインシデント対応における人間の立ち位置も変わる可能性があります。
第2回となる本記事では、そのような中で「インシデント対応の経験をどう手に入れるのか」「インシデント対応における優れた勘をどう獲得するか」というテーマについて扱います。
*1: 「どうやればインシデント対応能力を鍛えられるのか?」(「SRE Kaigi 2025」)
一次調査は誰が行うのか
インシデント発生時、誰が関連するログやメトリクスを調べ、原因候補と次のアクションを提示する一次調査を行うのでしょうか。AI以前はオンコール担当者が行うことが多かったかと思います。今でもそのような体制をとる組織は多いでしょうが、AIエージェントが一次調査をするケースが増えつつあるのではないでしょうか。
AWSのKiroチームが公開した事例では、深夜のアラームに対して原因の特定とネクストアクションの提示までを行っています*2。筆者の所属するフライルでも調査用のAIエージェントが常駐しており、一次調査をまかせることが当たり前になっています。現場対応していたエンジニアの作業内容から調査がなくなり、報告を読んで、精査し、次のアクションを決めることに変わりつつあります。つまり、仮説生成と検証の大部分をAIが担い、人間は提示された結果を基に判断するようになるといえます。
「AIエージェントに調査だけでなく判断までさせれば良い」と思う方もいるかもしれません。しかし、現時点のAIエージェントでは限界があり、2025年のベンチマークではSREシナリオの解決率が13%強に留まったという結果もあります*3。また、操作時の責任といった要因から、現時点では判断は人間が行うことが多いと思われます。
*2: 「How We Learned to Trust an AI Agent to Triage Production Incidents」
*3: ITBench「Evaluating AI Agents across Diverse Real-World IT Automation Tasks」
「判断」とは何をしているのか
では、インシデント時の判断とは一体何をしているのでしょうか。航空人間工学には「驚き(Surprise)」に関する研究領域があります*4。予期せぬ事象に遭遇した際の状況認識や判断、操縦に及ぼす影響を扱う領域です。
この驚き(Surprise)研究に「フレーム」という概念があります。フレームとは個々のデータを結びつけ、意味を与える説明構造のことです。フレームは経験によって作られ、入ってくる情報を選別し、意味づけます。熟練エンジニアが障害対応時に発揮する謎の勘、みなさんも一度は目にしたことがあるのではないでしょうか。その正体は、適用できるフレームの数と質と言えるかもしれません。
例えば、デプロイして5分後にp99レイテンシーが跳ねたとします。ここで「直前のデプロイが原因」というフレームを持っていれば、それを適用できます。適用した瞬間に、次に見る場所が決まります。コードの差分を開いて、変更箇所を確認し、ロールバックするかどうかの判断に向かいます。
ここまではほとんど考えていません。ここでロールバックしても直らない場合、フレームを使った予測と観測結果が食い違っていることになります。これがSurpriseです。ここで考え直しに移るのですが、切り替えられるかどうかが分かれ目となります。p99レイテンシーが跳ねた本当の原因は、同時刻に始まった月次バッチでした。ここで「直前のデプロイ」から「負荷の重なり」に切り替えが必要となります。月次バッチに関するフレームを持っている場合、切り替えが可能というわけです。
ただし、フレームを持っていることと切り替え可能かどうかは別の話です。フレームが外れた時の反応はフレームの「置き換え」「精緻化」「維持」です。
フレームの置き換えとは、別のフレームに完全に切り替えることです。フレームの精緻化とは現状のフレームと観測結果の部分的な不一致を認識し、より精度の高いフレームに調整することです。フレームの維持とは誤認知として現在のフレームを維持することです。フレームが外れたからといって自動的に別のフレームに切り替わるわけではありません。
具体的なフレームを持っていない新人の場合、適用するものがないため精緻化や切り替えが難しい。また、経験者の場合は強いフレームを適用した際に、それを手放せないという事象も起こりえます。
*4: 「Dealing With Unexpected Events on the Flight Deck: A Conceptual Model of Startle and Surprise, Human Factors, 2017」(Annemarie Landman ほか著)
フレームはどこで育つのか
AIエージェントが一次調査を担当することにより、現場担当のエンジニアは調査を手放し、判断に専念することになります。しかし、そのような分業は成立するのでしょうか。
AIエージェント以前にも、調査が楽になるような自動化や仕組み作りは行われていました。自分で調査した場合は時間がかかりますが、自分の中にフレームとして残ります。「このアラートはたいていディスクの逼迫が原因」というようなRunbookはフレームの外部化といえます。仮説と手順が提供されているのみで実行して確認するのは自分であり、一定のフレームは形成されます。AIエージェントの報告書も同じで、診断結果と根拠が含まれているので、それをフレームとして借りて判断できるという点では同じです。
しかし、AIエージェントの報告書からはフレームが形成されづらい。仮説生成と検証まで済んでおり、回すループがありません。もちろん、対処を手動実行することで、このアラートにはこの手、という結びつきは残ります。しかし、完成済みの推論を読むことと、不確実な状態から推論を組み立てることではフレームの獲得に差が生じます。
ここで「接触」という概念を定義します。接触とは、システムの一次情報に自分であたり、仮説を立てて確かめることです。例えば、異常状態を認識するためには正常状態を知っておく必要があります。どのサービスが何を担当しており、どこにログなどの情報があるか、何を調べると何が分かるかといった自分の中の地図は自分で手を動かすことで形成されやすくなります。そして、何か変更を加えて結果を見るような因果の体験も知識として読んで知ることとやってみるのでは自分の中に残るものが異なるでしょう。
失敗体験も重要です。間違った方向に調査をして時間を溶かす経験は誰でもあると思います。この経験がインシデント対応における勘を育ててくれます。身体知の獲得にも繋がります。インシデントが発生して緊張している時に自動的に手が動いてターミナル操作やコマンド実行、ログやメトリクスのチェックなどが行えるかどうか。AIエージェントが調査を担うことで接触が欠如し、新人は育たず、経験者は錆びついてしまうというわけです。
AIによる支援がスキル形成に及ぼす影響についてはAnthropicが調査しています。インシデント対応ではなくライブラリの学習ですが、この調査ではAI支援を使うことで習熟度が17%低いスコアとなる結果が出ています*5。
*5: 「How AI assistance impacts the formation of coding skills」
経験をどこで確保するか
では、どうやれば接触を増やし、フレームを育てられるのでしょうか。これまではインシデント対応という業務の中で自然に接触し、フレームが育っていました。AIエージェント時代にはこれを意図的に行う必要があり、何点か取り組みのアイデアを紹介します。
日常業務に接触が残るように設計すること
例えば、完全にAIエージェントに任せるのではなく、AIエージェントと並行して5分だけ自分自身で調査し、仮説を作ってみる。低リスクな変更を手で実行してみる。手を動かしたという身体知はAIエージェントでは得ることができませんし、平常時の感覚も自分で触らないと掴めません。低コストで実施可能です。
実インシデントに立ち会うこと
AIエージェントではなく人間が対応するインシデントに立ち会い、手順書にないような行動や意思決定について観察する。インシデント終了後、対応したメンバーに聞くことができるのも利点です。「自分ならどう行動するか」も考え、仮説と実際の判断を比べながら立ち会うことでより効果的になるでしょう。
訓練の場を作ること
日常業務では出会わない事象を意図的に作り、対応の訓練を行う。AI以前にも事例はあります。
例えば、freeeは2021年に標的型攻撃で情報を盗まれ、CEOに身代金を要求されるというシナリオで全社規模の訓練を実施しています*6。インシデント対応ではなくセキュリティ演習ですが、技術的な対応だけではなく「誰にいつ、何を伝えるか」という判断まで含めている点はインシデント対応でも同じです。
本格的になるほど実施コストは大きくなるのですが、その分学習効果も高くなるため、小さく始めるのがコツでしょう。訓練にできることはフレームの数を増やすことと、切り替えを鍛えることです。前者は経験の浅い新人に、後者は経験者に効果があるでしょう。ただし、定型的な訓練の場合予測可能性が高いため、フレームの切り替えが十分に鍛えられないことが考えられます。高コストですが、予測不能な訓練が望ましいでしょう。
ここまでの取り組みとは別に、メタ認知の技能を改善し、適用するフレームが合っていないことに気がつくことも重要です。フレームは入ってくる情報を選別し、意味を与える装置です。そして、合っているかどうかを判定するのも同じフレームです。判定する側とされる側が同じなのでフレームが合っていないことは内側からは見えません。しかも、食い違いが出るたびに「反映が遅れている」「キャッシュが残っている」といった小さな説明はいくらでも見つかります。次の一手が常にあるため、立ち止まる理由が生まれづらい構造です。そのため、「気づこうと意識する」だけでは機能しません。フレームの外に合図を置くことがポイントです。
例えば、15分という時間を設け、15分経っても仮説が変わっていない場合は、いったん止める。時計はフレームの外にあるので抜け出すトリガーになります。他にも、今適用しているフレームを宣言することも効果的です。声に出す、チャットに投稿することで他人が反証できるようになります。
*6: 「本当に怖い障害訓練、犯人はfreeeの中にいる!?」
おわりに
AIの進化に伴い、知の高速道路はより太くなり、速く移動できるようになりました。それでも経験による判断能力だけは速く手に入れることはできません。これまで、経験は業務の副産物として手に入っていました。今、そしてこれからのAI時代には意図的に確保しないと手に入らないでしょう。
この先、AIエージェントのさらなる進化によりインシデント対応時の判断も不要になる未来が来るかもしれません。しかし、本当に不要になるかは分かりません。人の成長には時間がかかります。エージェントの進化に賭けて外れた場合取り返しがつきません。学びを継続し、楽しんでいきましょう。
- この記事のキーワード
この記事をシェアしてください
