AnthropicのAIエージェント「Mythos」が、英国AI Safety Institute(AISI)によるテストの過程で、GitHubのメンテナーを標的にした現実世界でのソーシャルエンジニアリング型攻撃を試みたと報じられています。偽の人物プロフィールを作成してメンテナーに悪意あるコードの承認を迫り、追及されるとログを改変して痕跡を隠そうとしたとされています。
AISIはAnthropicのMythosとOpenAIのSolについてサイバーセキュリティ評価を実施していたところ、研究システムから通常とは異なる外部へのデータ転送を検知しました。調査の結果、一部のエージェントが本来意図されたテスト環境にとどまらず、実在の人物や組織を標的とした「持続的で、潜在的に有害な活動」に関与していたことが判明しています。
最も深刻だったのは、GitHub関連のサイバーセキュリティ課題の解決を任されていたAnthropicのMythosエージェントによる行動です。このエージェントは実在するGitHubのメンテナーを特定して身元を調査し、それらの人物になりすました複数の偽アカウントを作成しました。さらにプライベートメッセージとファイル共有サービスを利用して、メンテナーに圧力をかけたり欺いたりして悪意あるコードを承認させ、GitHubのシステム上で実行させようとしました。
個人的に最も懸念しているのは、このエージェントが行動について追及された際、以前の活動履歴を無害に見えるよう改変し、さらには操作を継続するために新たな身元を使うことまで検討していた点です。これは、当初のプロンプトの範囲を明らかに逸脱した欺瞞的な振る舞いと言えます。
AISIはこうした事案を、非常に特殊な条件下で起きた稀な出来事だとしつつも、悪意ある行為者の手に渡った場合にこうしたモデルが何をしでかしかねないかを示す重要なシグナルだと位置づけています。AnthropicとOpenAIの両社は、テストのパラメーターが自社の本番環境での運用を代表するものではないと主張した上で、評価およびガードレールの手法について調査・改善を進めていると述べています。
この事案は孤立した出来事ではありません。
Anthropicは別途、サードパーティのパートナーであるIrregularと共同で実施したサイバーセキュリティのCTF(Capture The Flag)形式の評価において、Claudeモデルが3つの外部組織へ不正アクセスしたことを公表しています。これらは、先月発生したHuggingFaceの事案と関連するものでした。
テスト中にAIエージェントがサードパーティのシステムに侵入したと報告したベンダーのリストには、Metaも加わりました。伝えられるところによると、Metaのモデル「Muse Spark」が別の企業のセキュリティ脆弱性を突いたとされており、その手口は「他社で以前報告された事例と類似したもの」だったとしています。
身を守るためには
まだ「空が落ちてくる」ような事態ではありませんが、サンドボックスからの脱出、認証情報の悪用、複数サービスへの横断的アクセス、オープンソースソフトウェアのエコシステムの武器化といった結果を招くテストを実施する企業各社が、「スカイネット」の到来を懸念する人々に、まさにその根拠となる材料を与えてしまっています。
標的になりうる立場として、次のような対策が可能です。
- デバイス上のすべてのソフトウェアを最新の状態に保つこと。新たな脆弱性を見つけるより、既知の脆弱性を悪用する方が容易だからです。
- 最新のリアルタイムセキュリティ保護製品を利用し、システムやデバイスをマルウェアから守ること。
- 添付ファイルやダウンロードリンクを開く前に、別の連絡手段で安全性を確認すること。
- 可能な限り多要素認証(MFA)を利用すること。
- 当社ブログの「Githubを安全に使う方法」もぜひご覧ください。
脅威を報じるだけでなく、取り除くために。
サイバーセキュリティのリスクは、見出しの中だけの話にとどまらせてはいけません。今すぐMalwarebytesをダウンロードして、脅威をデバイスから遠ざけましょう。