Z.aiのデフォルト有効なワークフローがローカルリポジトリ全体をクラウドインフラへ送信していたことが判明し、AIツールが機密性の高いソースコードをどう扱うかについて新たな懸念が浮上しました。
中国の人工知能企業Z.aiは今週、コーディング支援ツール「ZCode」のデフォルト設定に起因する問題を受け、複数の機能を無効化する事態となりました。ユーザーの同意なしに、ローカルのコードリポジトリを中国国内のAlibaba Cloudサーバーへ送信していたことが発覚したためです。この一件は、AIツールが機密性の高いソースコードをどのように扱うかについて、企業に新たな懸念をもたらしています。
同社は謝罪した上で、「必要な是正措置を完了した」とし、ZCodeクライアント内でローカルリポジトリのスナップショットを生成・アップロードしていたワークフローを無効化したと発表しました。X(旧Twitter)への投稿によると、最新リリースから当該機能を削除し、コードベースを公開して外部の検証を受け付ける体制にしたとのことです。
この問題は当初、中国人の独立系ブロガーによる技術的な調査で明るみに出ました。同ブロガーは異常なディスク使用量に気づき、それをZCodeのバックグラウンドプロセスに突き止めたと述べています。
「ZCodeにログインしている間、作業スペース全体――.gitの完全な履歴、LFSアセットキャッシュ、リフログ、グローバルなアプリ設定まで――を密かにパッケージ化し、暗号化した上でAliyun OSSへ直接アップロードしています」。中国人ブロガーのFerstar氏は、調査結果を詳述したブログ記事の中でこう述べています(同氏が提供した機械翻訳版による)。
同ブロガーによれば、ZCodeのコーディング支援機能はアクティブなファイルへのアクセスにとどまらず、開発環境全体をより広範に捕捉しており、事実上ローカルシステムからクラウドストレージへのパイプラインを作り出していたといいます。
同ブロガーは、データはAlibaba Cloudのオブジェクトストレージへアップロードされていたと説明しており、独自のロジックや組み込みの認証情報を含む企業のコードベースがローカル環境の外に出た後、どのように扱われるのかという懸念を提起しています。
Z.aiはこの問題を認め、発見したコミュニティの開発者らに謝意を示すとともに、脆弱性の報告・対応プロセスを継続していくことを約束しました。
対応の一環として、同社はリポジトリのアップロード機構を無効化し、関連するクラウドストレージのインフラを削除するとともに、ZCode v3.14.0クライアントに変更を加えたとしています。
Z.aiはまた、中国情報通信研究院(CAICT)とNSFOCUSに対し、セキュリティ評価の実施を依頼しました。
「NSFOCUSは、zcode-prod Alibaba Cloud OSSバケット内のすべてのデータオブジェクト、およびバケット自体が削除されたことを確認しました」とZ.aiは投稿の中で付け加えています。「Repo Wikiのエントリーポイントおよび関連する生成ワークフローは削除されており、ローカルリポジトリのスナップショット生成やローカルファイルの外部送信を引き起こし得る機能的な経路は確認されませんでした」
同社はまた、こうしたデータは一切保持されておらず、「モデルの学習に使用されたことは一度もない」とも述べ、アップロードされたコードの下流での利用に対する懸念にも言及しています。
AI支援ツールが曖昧にする企業のデータ境界
今回のZ.aiの事例では、Ferstar氏の調査結果により、デフォルトで有効になっているワークフローが、ユーザーの明示的な操作なしにローカル環境からクラウドインフラへリポジトリ全体をパッケージ化して送信し得ることが示されました。この挙動については、同社が後の是正措置の発表の中で対応を明らかにしています。
「これは本質的にAIモデルの問題ではなく、昔ながらのセキュリティアーキテクチャの問題です」。Semgrepのセキュリティアドボケイト、クリス・トーマス氏はそう語ります。コーディング支援ツールが「明示的に承認していない場所へ、リポジトリ全体をパッケージ化して送ってしまう」のであれば、問題はアクセス権限がどのように運用されているかにある、と同氏は指摘します。
「AIに専有のソースコードへのアクセスを許可する以上、何が端末の外へ出ていくのか、どこへ送られるのか、どのくらいの期間保持されるのか、誰がアクセスできるのかについて、明確な開示が求められるべきです。そして、デフォルトで有効にすべきは必要最小限の権限であって、最大限の権限ではありません」と同氏は述べています。
このリスクはクラウドベースの展開にとどまりません。ローカルで稼働するシステムであっても、ファイルシステムへの広範なアクセス権限や制限のないネットワーク接続が許可されていれば、機密データが露出しかねないと同氏は付け加えています。
Semgrepのスタッフセキュリティアドボケイトを務めるケイティ・パクストン=フィア氏は、「コードにどれだけ多くの知的財産が含まれているかを考えれば、それがサードパーティのクラウドプロバイダーに送信されることを人々が懸念するのも不思議ではありません」と述べ、企業は導入するAIツールをより厳格に精査する必要があると付け加えました。
OpenAIによるモデルの不整合や報告フレームワークに関する最近の開示も、予期しないシステム挙動の事例を指摘しており、AIシステムが展開時に完全には想定されていなかった形で動作し得ることを浮き彫りにしています。
この記事はInfoWorldに最初に掲載されたものです。
ギャナ・スワイン氏は、通信・IT分野の取材を20年以上手がけるベテランテクノロジージャーナリストです。VARINDIAのコンサルティングエディターを務めており、それ以前はCyberMedia、PTI、9dot9 Media、Dennis Publishingで編集職に携わってきました。著書2冊を持ち、業界への深い洞察と物語性のある筆致を融合させています。仕事を離れると、旅行とクリケットを愛する一面も持ち合わせています。Utkal大学で学士号(B.S.)を取得しました。