クラウド監視とは?オンプレミスとの違いや、基本項目を解説

IT Splunk

クラウドサービスの活用が進むなか、クラウドをどう監視するか、が新たな課題となっています。クラウドは、インフラの運用負荷を軽減できるメリットがあるとはいえ、監視をしなくてよいわけではありません。オンプレミス環境での監視とはどう違うのか、クラウド監視を成功させるためのポイントなどを基本から解説します。

クラウド監視とは

クラウド監視とは、企業が利用するクラウドサービス(IaaS・PaaSなど)について、稼働状況などを監視することを指します。サービスが適切に稼働しているか(障害が発生していないか)、パフォーマンスが低下していないか、そのほかの異常が発生していないか、などを監視し、安定利用を目指します。また、障害が起きてから検知するだけではなく、障害の発生前に対処できるよう事前に状況を予測すること、対応の自動化によりエンドユーザに影響をおよぼす前に問題を解決すること、なども含まれます。そして、IT運用管理(ITOM)や、SIEM(セキュリティ情報・イベント管理)SOAR(セキュリティのオーケストレーションと自動化によるレスポンス)、運用インテリジェンス(OI)など、様々な分野と役割が重なります。

複数のクラウドを利用する企業も増えており、利用するクラウド全体をどう監視するか、も大きなポイントです。全体を統合して監視することで、サービスごとの可用性を向上するだけではなく、ビジネスとしてのパフォーマンス・収益性などを含めた視点から運用改善につなげることもできます。

クラウド監視とオンプレミス監視の違い

オンプレミス環境に対しておこなってきた従来のIT監視を、クラウドに対しておこなうのがクラウド監視、と言えるでしょう。ただし、オンプレミス環境では、ハードウェアやネットワークなどのインフラから、OS・アプリケーションまで、すべてのレイヤーについてユーザ企業自身で監視する必要があるのに対し、クラウドでは、インフラを監視する必要はなく、オンプレミス環境と比べて監視する範囲が狭くなります。

クラウド監視とオンプレミス監視の違い

また、監視ツール(エージェント)のインストールや、監視する項目などの制約が一切ないオンプレミス環境に対し、クラウドでは、サービス事業者によって「監視ツールを独自にインストールできない」などの制約があります。また、専用の監視ツール・サービスが用意されているといったケースもあります。

クラウド監視が必要な理由

クラウドのメリットの1つとして、運用負荷の軽減があり、クラウド事業者に運用を任せられる点は大きな魅力とされています。しかし、「クラウドならば、監視が不要」というわけではありません。

一般的にクラウドサービスでは、クラウド事業者が責任を持って運用する領域が定められており、その領域以外は、ユーザ企業側で運用することになります。IaaSであれば、OSより上の領域、PaaSならばアプリケーションより上の領域は、ユーザ企業側で監視をおこない、トラブル発生時には、ユーザ企業自身で対処する必要があります。

障害やパフォーマンスの低下などのトラブルに気づくまでに時間がかかってしまうと、ビジネス停止・売上機会の損失などにつながりかねません。障害を迅速に発見し、対処するためにも、クラウド監視は不可欠です。また、最近ではクラウド環境もサイバー攻撃のターゲットとなるため、セキュリティ対策の一環としても監視は重要と言えます。

もう1つは、稼働状況やパフォーマンスを継続的に監視することで、「必要以上のスペックを割り当てていないか」を可視化できるようになります。クラウドでは、一般的にスペックによって料金が変わるため、利用状況にあわせてリソースをダウンサイジングすることで、コストの最適化も実現できます。

クラウド監視の基本項目

クラウド監視で、対象とする基本的な項目を下記にまとめました。

稼働状況

クラウドで稼働するサーバーやアプリケーションなどが、稼働しているかどうかを監視します。外部からサーバーにアクセスし、応答の有無で判断する、アプリケーションのプロセスが実行されていることを確認する(プロセス監視)などの方法があり、サーバー・システムのダウンによるトラブルを迅速に検出します。

リソース使用状況

CPUやメモリ、ストレージなど、リソースの使用状況を監視します。サーバーが稼働していても、負荷の集中などによりパフォーマンスの低下につながる可能性があるため、例えば、「CPU使用率が一定を超えたら、アラートを出してリソースを追加する」などの対処をおこないます。サーバー以外にも、マネージドサービス(サーバーレス関数やRDBサービスなど)のリソースを監視することも重要です。

異常の確認・検知

サーバーが稼働していても、アプリケーションが正常に動作しないケースに備え、稼働状況の監視とあわせて、アプリケーションに異常がないか、を監視します。例えば外形監視によるユーザーアクセスのシミュレーションや、APM(Application Performance Monitoring)によるアプリケーショントランザクションの分析が考えられます。また、サイバー攻撃による異常な動作・イベントがないか、などを検知する仕組みも必要です。

クラウド監視を成功させるポイント

クラウドの利用が進むことで、システムごとに稼働する環境が異なるなどIT環境は複雑化し、トラブル発生のスピーディな検出・対処は、より難しくなっています。効率的な監視を実現するために、下記のポイントを踏まえて検討しましょう。

複数のクラウドを一元管理できる

専用の監視ツールが用意されているクラウドもありますが、クラウドごとに異なるツールで監視するのでは手間がかかります。自社で利用するクラウドを一元的に監視できるツールの活用をお勧めします。リアルタイムに監視できること。また、規模が拡大しても対応できることも重要なポイントです。

セキュリティの観点を持って監視する

クラウド監視にあたっては、いかにセキュリティのリスクを検出し、被害を防げるか、も重要なポイントです。できるだけ早期にサイバー攻撃を発見し、迅速に対応するためにも、セキュリティの観点も踏まえて監視をおこない、異常検知時の対処フローまで検討しておきましょう。

環境を理解する

“異常”を適切に発見するには、まず通常時の状態を把握しなければ、始まりません。例えば、パフォーマンスを監視する際も、全体ではどこがボトルネックになるのか、パフォーマンスの低下が起きたときに、どこをチェックすべきか、どの程度の遅延まで許容するのかなど、考慮しておくべき点は多岐にわたります。パフォーマンスが低下した際の対処として、リソースの追加は有効な方法ではありますが、コストの観点から諦めざるを得ないケースもあります。その場合、「どの程度のパフォーマンス低下までを検知するか」を含めて、判断基準を明確にしておくことが重要です。

結論:クラウドを活用するなら、監視の仕組みも検討を

クラウドの活用が進み、重要なシステムがクラウド上で稼働するケースも増えています。ビジネス・業務を止めずに、安定して利用するため、クラウド環境にあわせた監視の仕組みは不可欠です。また、近年は複数のクラウドを、用途にあわせて使い分けるマルチクラウドのニーズも高まっており、クラウド全体をどう監視するのか、も大きな課題となっています。単にトラブルの発見・対処だけはでなく、目的や予算にあわせたリソースの最適化にも有効です。

Splunkは、複数のクラウドの情報を収集、監視し、必要な情報をダッシュボードで可視化します。また、AIを活用したリアルタイム分析により、問題を早期に検出し、システムのダウンタイムを最小化して、安定した運用を実現します。

関連記事

Splunkと4つのゴールデンシグナル
IT
7 分程度

Splunkと4つのゴールデンシグナル

監視の4つのゴールデンシグナルをSplunkの監視ユースケースに適用する方法をご紹介します。
監査ログ:完全ガイド
IT
6 分程度

監査ログ:完全ガイド

監査ログとは、システムの操作内容を記録したログファイルで、システムの運用や使用状況を把握するために使用されます。、「監査ログをどのように使用できるのか、また、どのようなユースケースで特に効果を発揮するのか」というシンプルな問いについて考えていきます。
クイックにMicrosoft Office 365 App for Splunkを導入する方法 - Vol.2
IT
2 分程度

クイックにMicrosoft Office 365 App for Splunkを導入する方法 - Vol.2

前編「Microsoft365側の設定」に続き、今回は後編としてSplunk側の設定について、実際の設定画面を見ながら解説します。Microsoft 365のデフォルトにある「監査ログ」を使った可視化が簡単に導入できます。