PR:AIレディ・エンタープライズのオブザーバビリティ格差を埋める

現代の企業はデジタル企業です。バックオフィスから工場のフロアに至るまで、接続されたシステムとデジタルサービスがあらゆる業務の土台となる運用基盤を形成しています。だからこそ、障害が発生すれば財務、評判、生産性、さらにはコンプライアンスにまで甚大な影響が及びかねません。この現実が、オブザーバビリティを取締役会レベルの課題へと押し上げています。

「上場企業にとって、重大なサイバーインシデントは開示義務を伴います。重大性を判断した時点から4営業日という猶予しかありません」と、NETSCOUTのエンタープライズ戦略ディレクターであるJack Callahan氏は説明します。「つまり、サイバー攻撃であれDDoS攻撃であれ、あるいは誰かがネットワークに不具合のあるアップデートをプッシュしたことが原因であれ、障害が発生した際に経営幹部が最初に直面する問題は同じです。それが重大性を伴うものかどうかを見極めることです」

それぞれの技術チームが互いに責任を押し付け合う中、オブザーバビリティは根本原因の特定、解決の迅速化、信頼性の向上に組織が必要とする「単一の真実の源」となります。しかし多くの企業では、期待通りの効果を発揮できていません。メトリクス、イベント、ログ、トレース(MELT)という従来のデータ基盤だけでは、今日のデジタルインフラの複雑さと規模の拡大にもはや対応しきれないのです。各組織はデータ量を増やし、サンプリングを強化し、保持期間を延長するという対応にとどまっていますが、それでも洞察の質が向上しているわけではありません。

「意思決定の材料となる大量のデータを手元に持っているはずの経営幹部でも、そのデータが期待するほど決定的なものではないと感じるケースが少なくありません」とCallahan氏は続けます。「そのため、投じているコストの大きさを考えれば意外なことですが、結局は自分の勘に頼る場面が想定以上に多くなっているのです」

こうしたオブザーバビリティの「負債」によるコストは膨らみ続けています。NETSCOUTのある調査によれば、組織の81パーセントが、データ不足がインシデント解決までの時間を長引かせていると考えています。5分の2強(42パーセント)は、1時間あたりのダウンタイムのコストを50万ドルから99万9,000ドルと見積もっています。

これらのコストは、経済的にも、それ以外の面でも持続不可能な水準に達しています。自律型AIの力を業務運用に活かすには、組織が全面的に信頼できるデータ基盤が不可欠です。これには新たなアプローチが求められます。経済的に無理のない形で、一貫性があり、包括的で、拡充され、リアルタイム性を備えたオブザーバビリティデータに根ざしたアプローチです。そして、それは既存のオブザーバビリティ投資を置き換えるのではなく補完する形で提供され、すでにエンタープライズのスタックに組み込まれているプラットフォームの価値をさらに引き出すものでなければなりません。

可視性が失われるところ

MELTデータは今なおオブザーバビリティに不可欠な要素です。しかし、それは今日のような複雑で分散的、かつ動的な運用環境を想定して設計されたものではありません。メトリクスは何かが時間とともに変化したことを示し、イベントは何かが変化した瞬間を明らかにし、ログは特定の時刻に何かが起きたことをチームに伝えます。しかし、これらはネットワーク上で実際に何が起き、なぜそれが起きたのかという文脈までは提供してくれません。

トレースは分散リクエストをサービス間で追跡するよう設計されているため、この点では最も近いところまで迫っています。しかし、トレースが示すのはあくまで計測対象として組み込まれた範囲だけであり、計測されていないコンポーネント、サードパーティへの依存関係、そしてその間に存在するインフラについては死角となってしまいます。そして、まさにそうした箇所でこそ問題が発生しやすく、結果として実際に何が起き、なぜ起きたのかという文脈が捕捉されないままになるのです。

文脈を捉えるとは、本質的には、異なるシステムをまたいで単一かつ完全で時系列の整った一連のイベントを再構築できることを意味します。何が引き金となり、それがどのように波及し、各段階で何が起きたのかまでを含めてです。ここにこそ、MELTのみに頼るオブザーバビリティ手法がしばしば失敗する理由があります。

タイムスタンプはシステムごとに一貫性を欠くことがあります。識別子はアーキテクチャの境界を越えると保持されないことがあります。サンプリングや集約によって、再構築に必要な重要な詳細が失われます。そしてデータは互換性のないスキーマを持つ異なるツールにまたがって保存されている場合もあります。ある調査によれば、組織の96パーセントがメトリクスとログを利用しているにもかかわらず、82パーセントが可視性のギャップを報告しており、ほぼすべて(96パーセント)がインシデント発生時に根本原因を特定するのに十分なデータを持っていません。可視性が失われやすいのは、オンプレミスとクラウドの境界(58パーセント)、エッジ(51パーセント)、あるいはサービス間のやり取り(39パーセント)といった、システムとシステムが接する箇所です。

AIが課題をより鮮明にする

こうした問題は、AIという文脈においてさらに深刻さを増します。多くの組織はすでに、効率性、意思決定、そして顧客体験を向上させるためにAI主導の業務運用を取り入れつつあります。しかし、システムが自律的に稼働し、マシン並みの速度で意思決定と行動を行うようになると、信頼できる結果を生み出すためには、高精度な文脈を備えたフォレンジックグレードのデータが必要になります。つまり、環境をまたいだシステム間のやり取りを保持する、継続的でサンプリングされていない記録が求められるということです。

自律性のレベルが高まるほど、ネットワークデータに対する信頼度もより高いレベルが要求されます。しかし、テレメトリはサンプリングや抽象化によって精度を失うことがあり、これらは大量のデータを扱うためにMELTで一般的に用いられる手法です。その結果生じる不完全で断片的なデータは、誤った相関関係、根本原因をめぐる曖昧さ、出力の不整合、そして部分的なシグナルへの過信を招きかねません。

「エージェントは、問題のトラブルシューティングに人間のような知性を働かせるわけではありません。手元にあるデータに基づいて判断を下すだけです」とCallahan氏は述べます。「ですから、部分的なデータ、あるいは周期的にしか取得されないデータ、サンプリングされたデータを与えてしまえば、その不確実性を急速に拡大させてしまうリスクを抱えることになります」

これは、多くの組織がようやく気づき始めた課題です。NETSCOUTによれば、AI支援によるインサイトを「非常に、または極めて一貫性がある」と評価する組織はわずか41パーセントにとどまります。同程度の割合(38パーセント)が、自動化されたアクションを検証するためのフォレンジックグレードのデータを欠いていることを認めています。また、29パーセントは環境をまたいだリアルタイムの可視性を持たないと回答し、28パーセントは自動化の出力を完全には信頼していないと答えています。

オブザーバビリティ格差を埋める

より優れたアプローチとは、ITチームが必要とする文脈を提供するために拡充されたMELTデータを中心にオブザーバビリティを構築しつつ、持続不可能なほどのコスト増につながる肥大化を避けることです。その出発点となるのがパケットデータ、すなわち実際にネットワークを通過したものの権威ある記録です。これにより、ITエコシステム全体にわたるトランザクション、依存関係、そして(人間・マシン双方の)相互作用に対する可視性が得られます。

ディープパケットインスペクション(DPI)技術を用いることで、この可視性はメタデータへと蒸留され、MELTに加えることでNETSCOUTが「MELT+」と呼ぶものが生まれます。

「デジタルサービスは、その構成要素間でやり取りされる情報を通じて可視化されます。NETSCOUT Smart Dataは、こうした観測された相互作用をトランザクションレベルのエビデンスへと変換します。通信が成功したかどうか、トランザクションがどのように実行されたか、遅延や失敗がどこで発生したか、どのサービスが影響を受けたか、そしてID情報が得られる場合にはどのユーザーが影響を受けたかといった情報です。これにより、運用チームやAIシステムは、実際に何が起きたのかを理解するためのより完全で信頼できる基盤を得ることができます」と、NETSCOUTのフィールドマーケティングマネージャーであるSteve Horneman氏は説明します。

「多くのテレメトリは個々のコンポーネントの状態を記述するにとどまります。これに対しNETSCOUTは、コンポーネント間の相互作用そのものを観測し、そのアクティビティが発生する瞬間に意味を生成します。個々のシステムが報告する情報だけに頼るのではなく、独立して観測されたトラフィックから早い段階で文脈を抽出することで、デジタルサービスが実際にどのように振る舞ったかについて、運用プラットフォームとAIによりよい整合性のある情報を提供できます。これは、単にテレメトリを増やすことと、自信を持って意思決定を下せるだけのエビデンスを作り出すこととの違いです」

ある事例は、このアプローチの利点を如実に示しています。ある製品メーカーは、無線接続の問題が原因で世界各地の拠点で自動誘導車両(AGV)が停止し、1時間あたり50万ドルの生産性損失が発生していることを突き止めました。障害はおよそ3週間ごとに発生していました。既存のロボティクス用テレメトリでは根本原因を特定できませんでしたが、NETSCOUTを導入したところ問題の原因を特定でき、AGVの障害を数秒以内に検知するプロアクティブな監視モデルを採用するに至りました。トラブルシューティングにかかる時間は数時間から数分へと短縮され、同社は年間数千万ドル規模のコスト削減を実現しました。

MELT+のメリットは、障害や運用インシデントにとどまらずサイバーセキュリティにも及ぶ、とHorneman氏は続けます。「この戦略的な価値はオブザーバビリティの範囲にとどまりません。独立して観測された同じ相互作用のエビデンスは、企業の境界における運用保証を支えるだけでなく、内部でのサービス間の振る舞いや潜在的なラテラルムーブメントを可視化し、運用、セキュリティ、AIの各システムに共通のエビデンス基盤を提供します。各チームがそれぞれ異なるバージョンの出来事を解釈するのではなく、同じ観測された現実に基づいて推論できるようになるのです」と同氏は述べます。

NETSCOUTの試算によれば、ネットワークトラフィックデータを権威ある情報源として扱っている組織は、可視性のギャップがまれにしか発生しないと回答する割合がおよそ3倍高くなっています(50パーセント対18パーセント)。こうしたネットワーク上の出来事に対する深い洞察力こそが、同じパケット由来のインテリジェンスをフォレンジック分析チームにとっても価値あるものにしているのです。

「攻撃者がいったんホストに対する権限を手に入れてしまえば、そのホストが自ら生成するテレメトリにもアクセスできてしまいます」とCallahan氏は言います。「巧妙な攻撃者はまさにその手口でラテラルムーブメントを隠蔽します。しかし、彼らにもできないことがあります。それは、すでにネットワークを通過したパケットをさかのぼって書き換えることです。これは、より高い正確性と、より完全な視点をもたらします」

メタデータがSmart Dataになるとき

NETSCOUTのアプローチは、DPIを用いてネットワークからライブかつサンプリングされていないパケットを直接観測し、それをAdaptive Service Intelligence(ASI)によって高精度なメタデータへと変換するというものです。これは従来型MELTが抱える主要な課題、すなわち規模、効率性、コスト、そしてデータの豊富さに対応するために設計されています。

NETSCOUTは、個々のアプリケーションやサーバーを監視するのではなく、ネットワーク内の戦略的なポイントからトラフィックを観測することで、テレメトリの量、取り込みコスト、そして複雑さを削減します。パケットデータを分析し、取得時点で生成されるメタデータであるSmart Dataへと蒸留することで、下流で移動、保存、保持する必要があるデータ量を削減します。

その結果、顧客が得られるのはMELTを補完しつつも、経済的により持続可能で、ネットワーク由来のより完全なデータを生み出し、既存のオブザーバビリティプラットフォームに取り込まれることでTCOのさらなる削減にもつながるアプローチです。

また、これはアナリスト企業であるFuturumが自律型AI運用の重要な基盤と表現するものでもあります。抽象化されたものではなく、検証可能なネットワークの振る舞いと観測された相互作用を捉えるデータ。個々のアプリケーションが計測対象として組み込まれているかどうかにかかわらず包括的な可視性を確保し、サンプリングによる欠落のない完全な視点を提供するデータ。そして、サービスの境界を越えた順序性と因果関係を示しながら、オブザーバビリティ、セキュリティ、運用の各チーム間で一貫性を保つデータです。

「MELTだけでは、AIOpsを稼働させるための十分なデータ基盤とは言えません」とCallahan氏は述べます。「私たちは、プロセスのより早い段階で必要な文脈をより多く含んだデータを生成できます。その結果、より豊かなデータがプラットフォームに流れ込むことになるのです」

これはまだ始まりに過ぎない

MELT+のようなアプローチには明白な利点があるにもかかわらず、NETSCOUTの調査データによれば、完全な精度を備えたネットワークデータを権威あるものとして扱っている組織はわずか11パーセントにとどまります。この数字を変えたいと考えるCIOにとって最初の一歩は、NETSCOUTのCOOであるSanjay Munshi氏が示している5つの重要な基準に照らして、現在のオブザーバビリティデータを評価することです。

まず、あらゆるクラウド、サービス、アプリケーション、ネットワーク、ベンダーを網羅する包括性を備えていること。次に、ストレージとコストを最適化するために目的に応じて構築されたフィード群による厳選性を備えていること。そして、サービス、アプリケーション、ユーザーが文脈の中でどのように振る舞うかを示す、検証可能な相互作用の連鎖という信頼性を備えていること。さらに、あらゆるユースケースにわたる一貫性を備えていること。そして最後に、動いているデータに対する継続的でリアルタイムの洞察を提供できることです。

「MELTのコスト削減に取り組んできたのであれば、それと同時にアプリケーションチームやエージェントが持つ文脈情報も削ってしまっていたことになります。しかし、もはやどちらか一方を犠牲にしてもう一方を得る必要はありません」とCallahan氏は結論づけます。

「テレメトリのコストにお悩みなら。今この瞬間の意思決定やコンプライアンス報告に必要なデータを確保できているかご不安なら。AIのパイロット運用を本番環境へと移行させる方法を模索しているなら。私たちは、皆様が日々利用しているプラットフォームの中で、すでに取り組んでいることをさらに強化するお手伝いができます」

Sponsored by NETSCOUT

翻訳元: https://www.theregister.com/security/2026/09/23/sponsored-closing-the-observability-gap-for-the-ai-ready-enterprise/5298070

本記事は theregister.com の記事を翻訳・要約したものです。