AIOpsとは?AIOpsの基本

Artificial Intelligence Stephen Watts

AIOps (AIによるIT運用)とは、ビッグデータ、分析、機械学習を使用してIT運用(ITOps)を自動化および改善する手法です。AIは、大量のネットワークデータやマシンデータを分析することで、パターンを検出したり、既存の問題の原因を特定したり、将来の問題を予測して防止する方法を判断したりできます。そのため、異常検出やイベントの相関付けなどのITOps機能では、AIがとりわけ重要となります。

この記事の内容

今日のデータ環境は、マイクロサービス、マルチクラウドアーキテクチャ、ハイブリッドクラウドアーキテクチャ、コンテナなどで構成され、複雑化しているのに加え、分散システムが普及したことで、ログデータやパフォーマンスデータが大量に発生して管理が難しくなっています。こうしたデータは、あっという間にITアナリストの手に負えなくなり、ネットワークの健全性と安全性の可視化が妨げられる可能性があります。AIOpsソリューションは、IT担当者がこのような問題を解決するのに役立ちます。つまり、人間の介在なしで資産を効果的に監視し、ITシステムの内部と外部の両方で依存関係を可視化します。

この記事では、AIOpsの仕組み、さまざまなユースケースとメリット、そして組織でAIOpsを効果的に導入する方法について説明します。

AIOpsの基本

2016年、ガートナー社は「Algorithmic IT Operations」(アルゴリズムIT運用)の略語として、「AIOps」という用語を作り出しました。その意図は、AIOpsを次世代のIT運用分析(ITOA)と位置付けることでした。しかし、その後1年ほどで、ガートナー社はこの用語を、「Artificial Intelligence for IT Operations」(人工知能によるIT運用)に変更しました。これはわずかな変更でしたが、AIOpsというコンセプトを広めるうえで、非常に大きな変化をもたらしました。

AIOpsの目的は、AIの特徴である処理の速さと正確さをIT運用に取り入れることです。ネットワークの拡大と複雑化が進む今日、IT運用管理は一段と難しいものになってきています。従来の運用管理ツールや手法ではもはや、多様化した複雑なネットワーク内のさまざまなソースから発生する未曾有の量のデータに対応できません。AIOpsツールは、以下の機能によってこの課題を解消します。

AIOpsプラットフォームのイメージ
機械学習とビッグデータを活用するAIプラットフォームは、IT運用で大きなビジネス価値を生み出す一助となります。

AIOpsプラットフォーム

ガートナー社は次のように説明しています。「AIOpsプラットフォームとは、ビッグデータと機械学習を組み合わせて、生成されるデータをスケーラブルに取り込み、分析することにより、IT運用を支援します。AIOpsプラットフォームでは、複数のデータソース、データ収集方法、分析技法、表示方法を同時に使用できます」

AIOpsプラットフォームで何よりも求められるのは、保存されたデータの分析と、データの取り込み時点でのリアルタイム分析の両方の機能を備えていることです。ガートナー社は、AIOpsプラットフォームの主要機能を以下のように定義しています。

AIOpsプラットフォームは、複雑なデータエコシステムの管理にまつわる課題の急増に対処します。ガートナー社は『AIOpsプラットフォームのマーケットガイド』(2022年版)の中で、「AIOpsプラットフォームを導入した企業は、その利用を拡大する中でデータ管理のコストと複雑さの問題に直面している」としながらも、「AIOpsプラットフォームの導入が企業の間で急速に進んでいる」と指摘しました。

このことから、クラウドコンピューティングやデータ環境を効率化し、費用対効果と管理性を高めたいと考えている組織にとって、AIOpsプラットフォームは今後も魅力的なソリューションとなるでしょう。

AIOpsの主なユースケース

ガートナー社によると、AIOpsの主なユースケースには以下の5つがあります。

  1. ビッグデータ管理(量、多様性、変化、速度)
  2. パフォーマンスの監視と分析
  3. 異常検出
  4. イベントの相関付けと分析
  5. ITサービス管理
機械学習を活用したAIの応用
ガートナー社によると、AIOpsの主なユースケースは、ビッグデータ管理、パフォーマンス分析、異常検出、イベントの相関付け、ITサービス管理の5つです。
  1. パフォーマンス分析:AIOpsの主なユースケースの1つがパフォーマンス分析です。AIと機械学習を活用して、大量のイベントデータをすばやく収集、分析し、問題の根本原因を特定します。IT部門の主要業務の1つであるパフォーマンス分析は、今日、データの増加と多様化によって複雑さを増しています。そのため、従来の手法では、たとえ機械学習テクノロジー内蔵のツールを使っても、データの分析が困難になりつつあります。AIOpsは、より高度なAI技法を取り入れて大規模データセットを分析することで、データの増加と複雑化の問題に対応します。将来起こりうる問題を予測し、根本原因分析をすばやく実行できるため、問題を未然に防ぐことも可能です。

  2. 異常検出:ITの異常検出(「外れ値検出」とも呼ばれます)では、データの中から、問題があることを示唆する異常値、つまり、データセット内で履歴データと比較して突出しているイベントやアクティビティを特定します。これらの異常値は、異常イベントとも呼ばれます。

    異常検出は、アルゴリズムに基づいて行われます。トレンド分析アルゴリズムでは、単一のKPIについて、現在と過去を比較して動作が監視されます。スコアが異常なほど高くなると、アラートが生成されます。凝集分析アルゴリズムでは、動作が類似する一連のKPIが監視され、1つ以上が他と異なる動作をすると、アラートが生成されます。

    AIOpsでは、より迅速で効果的な異常検出が可能です。KPIの動作が識別された後、その実際の値と機械学習モデルの予測値との差が異常に大きくなっていないかが自動的に監視されます。

  3. イベントの相関付けと分析:イベントの相関付けと分析では、関連する複数の警告によって生成される大量のイベントを解析して、その基となる原因を究明し、修復方法を特定します。従来のITツールでは警告が大量に発生するだけで、問題に関するインサイトは得られません。

    AIOpsでは、類似性に基づいて重要なイベントが自動的に分類されます。これによって、イベントを常時管理する負担を減らし、不要で煩わしいイベントトラフィックやノイズを削減できます。AIOpsでは、イベントの受信時にルールベースのアクション(重複イベントの統合、アラートの抑制、重要イベントの解決など)が実行されます。

  4. ITサービス管理:ITサービス管理(ITSM)は、社内ITサービスの設計、構築、提供、サポート、管理に関するすべての作業を包括する用語です。ITサービスを社内のエンドユーザーに提供するためのポリシー、プロセス、手順の設定もITSMに含まれます。

    ITSMにAIOpsを導入するメリットは、AIでデータを分析してすばやく問題を特定し、解決につなげることで、IT部門の作業効率と効果が高まることにあります。ITSMのユースケースでは、ITサービスデスクの監視やデバイスの管理など、さまざまなデータを対象にできます。

    ITSMにAIOpsを取り入れると、IT部門では以下を実現できます。

    • マルチクラウド環境でインフラストラクチャのパフォーマンスを管理する
    • キャパシティプランニングで予測精度を上げる
    • 容量を自動的に調整してストレージリソースを最大限に活用する
    • 履歴データと予測に基づいてリソースの利用率を向上させる
    • ITサービスに関する問題を特定、予測、予防する
    • ネットワークに接続されたデバイスを管理する
  5. 自動化:従来の監視ツールでは、インシデントを理解、対応、解決するために複数のソースの情報を手動でまとめなければならないことがよくあります。AIOpsでは、データが複数のソースから自動的に収集されて相関付けられるため、迅速さと正確さを大幅に向上できるという大きなメリットがもたらされます。社内の以下のIT運用作業で、このAIOpsによる自動化機能を活用できます。

    • サーバー、OS、ネットワーク:複数のサーバーのすべてのログ、メトリクス、設定データ、メッセージ、トラップを収集して、検索、相関付け、アラート生成、レポート作成に使用できます。
    • コンテナ:コンテナデータを収集、検索し、ほかのインフラストラクチャのデータと相関付けして、サービスのコンテキスト、監視、レポートの精度を向上させることができます。
    • クラウド監視クラウドインフラストラクチャのパフォーマンス、使用率、可用性を監視できます。
    • 仮想環境の監視:仮想スタックを可視化したり、イベントの相関付けを高速化したり、仮想コンポーネントと物理コンポーネントでトランザクションを横断的に検索したりできます。
    • ストレージ監視ストレージシステムの状況を、関連するアプリケーションのパフォーマンス、サーバーの応答時間、仮想化のオーバーヘッドと関連付けて把握できます。

AIOpsを導入するビジネス上のメリット

AIOpsでIT運用業務を自動化し、AIを活用してシステムのパフォーマンスを向上させることにより、企業はビジネス面で大きなメリットを得ることができます。以下に例を示します。

KPIを高めるAIOps
AIOpsは、ダウンタイムの回避、データの相関付け、根本原因分析の迅速化、エラーの発見と修正など、数え切れないほどのメリットを組織にもたらすため、各部門のリーダーはコラボレーションする時間を増やすことができます。

クラウドコンピューティングとオンプレミスの両方でITインフラとアプリケーションのパフォーマンスを改善することで、AIOpsはビジネスの成功を評価するKPIを高めます。

AIOpsで解決できるIT運用課題の多くは、すべての業界に共通です。ただし、医療、製造、金融サービスなどの業界では、他の業界と比べて問題が蔓延し、脅威が深刻化しています。それでも、AIOpsでIT運用を自動化し、AIを活用してシステムのパフォーマンスを向上させることにより、企業はビジネス面で大きなメリットを得ることができます。以下に例を示します。

医療IT (HIT)でのAIOpsの用途

製造業向けITでのAIOpsの用途

金融サービス向けITでのAIOpsの用途

AIOpsの未来

近年、AIOpsプラットフォームは企業で大きな人気を博しています。実際、さまざまな業界の企業がAIOpsをデータ環境の管理に欠かせないツールと見なし、IT運用管理(ITOM)業務全体に利用を拡大しています。そのため、AIOps市場は大きな成長が見込まれており、減速する兆しはありません。ガートナー社は、AIOps市場の規模が2025年までに約21億ドルに達し、年平均成長率(CAGR)が約19%になると予想しています。同じように、Future Market Insights社は、AIOpsプラットフォーム市場の規模が2032年までに802億ドルに達し、2022年と比較して2032年のCAGRが25.4%増加する可能性が高いと見ています。

また、ChatGPTの爆発的な成長に伴い、生成AIがAIOpsの開発と進化に一定の役割を果たすことが考えられます。TechTarget社は記事の中で、生成AIがアプリケーションコードの開発や、テスト生成などの日常的なエンジニアリングタスクで使われる可能性があることを示唆しています。オブザーバビリティ機能や、レジリエンスワークフロー(侵入テストなど)の自動化にも、生成AIの波が押し寄せるかもしれません。オーディオファイルやチャットファイルのような非構造化データセットの分析でも、生成AIが使われる可能性があります。

生成AIがこうした機能にどのような影響を与えるのか、確かなことはまだわかっていません。しかし、デジタルトランスフォーメーションの取り組みにAIOpsが組み込まれるようになると、生成AIの果たす役割はますます大きく、かつ重要になる可能性があります。

エキスパートの視点

AIOpsの将来の役割をさらに深く理解するため、NETSCOUT社で副最高執行責任者を務めるSanjay Munshi氏に、AIOpsの重要性と将来に関する見解を伺いました。

「経営幹部は、AIに大きな信頼を寄せて大規模な投資を行い、期待どおりの革新的な成果が得られることを望んでいます。しかし、すべてのAIシステムやプラットフォームが、ビジネス成果の向上に適したデータ基盤を備えているわけではありません。AIの成果は、受け取ったデータの質に左右されます。つまり、質の低いデータからは、低い成果しか出せません。不完全なデータや抽象化されたデータで構築されたモデルは、十分なパフォーマンスを発揮できないばかりか、誤った情報に基づいてビジネス上の意思決定を下すリスクをもたらします。

AIやAIOpsシステムを適切に機能させるには、データ戦略を根本的に変えなければなりません。そのためには、インフラ構成の静的な要素に依存せず、ハッカーの活動を可視化する堅牢な分散型センサーフレームワークが必要です。センサーソフトウェアは、データインテリジェンスをソース側で収集、分析、整理して、忠実度の高いデータを提供します。それだけでなく、メトリクス、ログ、またはトレースのみに基づいて構築されたデータモデルを補完する役割も果たします。

修復の迅速化、対応の自動化、信頼性の高い結果によるユーザーエクスペリエンスの向上など、期待されている成果を達成するには、企業全体から収集され、整理および補強された高品質で実用的なデータを基盤として、高性能なAIを構築することが欠かせません」

導入を開始する方法

AIOpsを使い始める最善の方法は、段階的に導入することです。ITドメインをデータソースごとに再編して、スモールスタートで着手するのがベストプラクティスです。各種のソースから取り込まれる大規模で持続的なデータセットの処理方法を学んで、IT運用チームに、AIOpsでのビッグデータの扱いに慣れてもらいましょう。履歴データから始めて、新しいデータソースを徐々に追加しながら、適用範囲を広げていくことをお勧めします。

まずはデータの取り込みに重点を置く:取り込みと分析をすばやく効果的に行うには、いきなりすべてのデータを対象にしないことです。まずは、過去の未加工(Raw)のマシンデータやメトリクスデータを取り込み、分析して、基本を理解し、クラスタリングアルゴリズムとクラスター分析を用いて、トレンドやパターンを特定してみましょう。リアルタイム検出を実現するには、Rawデータが最適なデータタイプです。その後、ストリーミングデータを分析対象に加え、機械学習によるAIを取り入れて、検出したパターンとどのように適合するのか調べることで、自動化を実現し、最終的に予測分析につなげることができます。

できるだけ多くのタイプのデータを取り込んで分析する:システムの過去の状態を分析し、理解すれば、現在の状態と相関付けて状況を把握できます。そのためには、履歴データとストリーミングデータを広範囲に取り込み、これらのデータへのアクセスを可能にする必要があります。ログ、メトリクス、テキスト、ワイヤー、ソーシャルメディアなど、どのタイプのデータを取り込むかは、解決したい課題によります。たとえば、インフラストラクチャの容量を監視したい場合は、そのメトリクスデータを取り込み、カスタマーエクスペリエンスを向上させたい場合は、アプリケーションログを取り込みます。最終的にAIOpsプラットフォームを選定する際には、複数のソースからデータを取り込んで分析できるかどうかを確認することをお勧めします。

すべてを一度にやろうとしない:まずは、優先度が最も高い課題について、その根本原因を見つけることに集中しましょう。その後、データの監視を開始します。それからがAIの出番です。さらにそこでも、以下の段階を踏むことが重要です。

AIOpsを使い始める:Splunk IT Serviceでのイベント相関付けの基本と大量のアラートの検出

まとめ

AIOpsへの投資がビジネスを強化

ITやネットワークの担当者であれば、データは企業にとって最も重要な資産であり、世界を一変させるほどの可能性を持つという話を繰り返し耳にしているでしょう。AIは革新的なテクノロジーであり、すでに普及段階にあります。そしてAIOpsは、AIやビッグデータに対する期待が高まる中、ビジネスイニシアチブを実現するための具体的な方法を提供します。セキュリティの強化から、業務の効率化や生産性の向上まで、AIOpsは、IT運用を成長、発展させて、将来の課題に対応できる体制を整え、IT部門の役割を事業拡大の戦略的促進要因として定着させるための実践的な手段を目の前に提示しているのです。

このブログはこちらの英語ブログの翻訳です。

関連記事

SplunkとRAGで実現するエンドツーエンドのLLMオブザーバビリティ構築術
AI
12 分程度

SplunkとRAGで実現するエンドツーエンドのLLMオブザーバビリティ構築術

大規模言語モデル(LLM)は、あらゆる業界でユーザーエクスペリエンスを再定義しています。Splunk AI Assistantが検索拡張生成(RAG)システムを活用し、厳選された公開コンテンツに基づいて、よくある質問(FAQ)に対して迅速かつ正確な回答を提供する仕組みをぜひご覧ください。
CIO向けSplunk AI Toolkitガイド:後追い対応のITから予測型ITへ
AI
5 分程度

CIO向けSplunk AI Toolkitガイド:後追い対応のITから予測型ITへ

SplunkのAI Toolkitは、チームがインシデントを予測し、ダウンタイムを削減し、デジタルレジリエンスをエンタープライズ規模で実現できるよう支援します。
複雑なデータをすっきりと:AIを活用し、あらゆるレベルで不正、無駄、悪用に関する調査を簡素化する
AI
5 分程度

複雑なデータをすっきりと:AIを活用し、あらゆるレベルで不正、無駄、悪用に関する調査を簡素化する

AIとSplunkで不正調査を簡素化する方法をご紹介します。