Lavaによると、インターネットに公開されたグラフィックス処理装置(GPU)サーバー数百台が、NVIDIAのDCGM Exporterに存在する深刻度の高い脆弱性(CVE-2026-47483)にさらされていました。認証なしの攻撃者が監視サービスをクラッシュさせることができ、AIワークロードに支障が出るおそれがあります。
Lavaはこの脆弱性をNVIDIAに報告しました。NVIDIAはCVSSスコアを8.2と評価し、2026年7月28日にセキュリティ情報を公開しています。
GPUサーバーは、GPUを中核に構成されたコンピューターで、AI、機械学習、科学技術計算のワークロードに使われます。DCGM Exporterは監視ツールで、ホスト上のGPUから温度、使用率、メモリ使用量、消費電力、エラーイベントなどのデータを直接読み取ります。これらのデータをHTTPで(通常はポート9400で)公開し、Prometheusなどのシステムが収集できるようにします。
このデータには、正確なGPUモデルと、GPUごとの一意なID(UUID)も含まれます。Lavaの研究者Michael Katchinskiy氏によると、これだけで攻撃者になりうる者は、サーバーがどんなハードウェアで動いているか、どの程度負荷がかかっているか、エラーが発生しているかを把握できます。
これらのエンドポイントが明かす情報の多さに気づいたKatchinskiy氏は、「インターネットに公開されているものはどれくらいあるのか」と考えました。
公開されていた範囲
Katchinskiy氏のチームは、Exporterをインターネットに公開しているサーバーを2,000台以上確認しました。2026年3月から5月にかけて4回スキャンを実施したところ、これらのサーバーが報告したユニークなGPUは1万2,000基を超え、推定総額は1億ドルに上ります。
「すべてのホストが平文のHTTPでメトリクスを返しており、認証を求めるものは1つもなかった」と、Katchinskiy氏は書いています。
公開されていたハードウェアには、大規模なAIワークロード向けのNVIDIA Blackwell Ultra B300、H200、H100のGPUのほか、コンシューマー向けのRTX 5090や4090も含まれていました。

(出典:Lava)
公開されていたExporterは、300近い組織のものでした。公開されていたGPUのうち5,274基(44%)は米国に置かれており、次いでルーマニアが2,054基、中国が1,967基でした。
公開されていたサービスの一部は、Voltage Park、Lambda、Northern Data、DigitalOceanといったGPUクラウド事業者の顧客インフラ上で稼働していました。
最も多かったのはVoltage Parkに関連するグループで、公開されたNode Exporterホストが672台、公開されたDCGM Exporterホストが71台ありました。同社は、Node Exporterのインスタンスの大半とDCGM Exporterのインスタンスのすべてが顧客によって展開されたものだと認めています。セキュリティチームは、影響を受けた顧客に連絡を取りました。
デバッグ用エンドポイントでExporterをクラッシュ可能
公開されていたホストのおよそ4分の1は、/metricsに加えて、Goの/debug/pprof/プロファイリングエンドポイントも提供していました。これらのエンドポイントの一部は、呼び出し側が指定した時間だけリクエストを開いたままにします。認証なしの同時リクエストが大量に届くと、メモリ消費が増えます。
Katchinskiy氏によると、チームは当初、プロファイリングエンドポイントの公開は運用者の設定ミスによるものだと考えていました。しかし、NVIDIA公式のDCGM Exporterコンテナーを改変せずに使っても、同じ挙動を再現できました。
Exporterをルーティング可能なインターフェースで公開する構成では、/debug/pprof/も公開される可能性があります。
「認証なしの同時リクエストが十分に多ければ、Exporterはメモリ不足でクラッシュし、GPUの健全性や稼働状況が見えなくなる可能性がある」と、同氏は説明します。
CPUとRAMへの負荷によってホストが遅くなり、そこで動くトレーニングや推論のワークロードに影響する可能性もあります。特に、厳格なリソース制限を設けていない場合です。チームが確認した公開DCGM Exporterのうち数百台で、この攻撃対象領域が公開されていました。
Node Exporterからサーバーやネットワークの情報が漏えい
研究者らは、サーバーのハードウェアとOSを監視するPrometheus Node Exporterも調べました。NVIDIA/MellanoxのInfiniBandおよびRoCEアダプターのメトリクスを報告する公開Node Exporterホストが、1万2,096台見つかりました。アダプターのモデル、ファームウェアバージョン、リンク状態、ファブリックの動作状況が公開されており、ホスト名、OSやカーネルのバージョン、BIOSの詳細が分かるものもありました。
あるエンドポイントは、Ubuntu 22.04.5 LTSを実行するDell PowerEdge XE9680、そのBIOSとアダプターのファームウェア、稼働中の400 Gb/sポートを特定できるだけのデータを返していました。
「正確なバージョンが分かれば、攻撃者は該当する既知の脆弱性へ一直線に進める。Node ExporterとDCGM Exporterが重なる環境では、GPUの動作をサーバー、ソフトウェアスタック、周辺のネットワークと結びつけられた。しかも認証は一切不要だ」と、Katchinskiy氏は指摘しています。
修正と緩和策
DCGM Exporterのユーザーは、バージョン4.8.2以降にアップグレードしてください。プロファイリングが必要な場合を除き、–enable-pprofフラグはオフにしておく必要があります。最新バージョンでは、プロファイリングエンドポイントは明示的に有効にした場合のみ使えます。
Katchinskiy氏は、特別な必要性とアクセス制御がある場合を除き、Node Exporter、DCGM Exporter、Prometheusをパブリックなインターネットに公開しないよう勧めています。Exporterはループバックまたはプライベートのインターフェースにバインドし、ファイアウォールルールやセキュリティグループで監視基盤からのアクセスだけに制限するべきだとしています。Prometheusのクエリ APIやターゲットページにも、同様の保護が必要です。
「今回の調査で、公開された監視サービスが基本的なテレメトリをはるかに超える情報を明かしてしまうことが分かった。数千のシステムで、どのGPUが稼働しているか、どう使われているか、周辺のサーバーやネットワークの詳細まで確認できた」と、Katchinskiy氏は述べました。
DCGM Exporterの場合、公開による影響は「可視化にとどまらず」、攻撃者がリソースを枯渇させてGPU監視をクラッシュさせ、同じホスト上で動くワークロードにまで影響を及ぼす可能性があると、同氏は付け加えています。
「AIインフラの規模が拡大するなか、組織はスタックのあらゆる層を守り、自社の責任範囲とプロバイダーの責任範囲を正確に把握する必要がある」と、Katchinskiy氏は結論づけました。
翻訳元: https://www.helpnetsecurity.com/2026/10/09/nvidia-dcgm-exporter-vulnerability-cve-2026-47483/