OpenAIは、社内テストにおいて次期モデル「Astra」がサイバーセキュリティ分野で重大な能力の閾値に近づく可能性があることが示されたとして、フロンティアAIのトレーニングを一時的に減速させました。
今回の決定は、能力を増し続けるAIシステムが、人間による限られた指示のもとでソフトウェアの脆弱性を自律的に特定・分析し、場合によっては悪用しかねないという懸念の高まりを浮き彫りにしています。
OpenAIによれば、同社はデプロイ可能な強化学習モデルのトレーニングを2週間停止し、計画していた中で最大規模のフロンティア強化学習の実行についても保留としました。
一方、小規模なトレーニングの実行、能力評価、アライメント研究、セキュリティテストについては、管理を強化した上で継続されています。
この措置は、Hugging FaceのDiffusersモデルを巡るセキュリティインシデントや、高度なモデルがツールを活用したより長時間の技術的タスクをこなせるようになっているという広範な証拠を受けたものです。
コードを書き、接続されたシステムを閲覧し、コマンドを実行し、複数段階にわたる問題を推論できるモデルは、ソフトウェアベンダーや防御側がまだ把握していないゼロデイ脆弱性を含む、脆弱性の発見を大幅に加速させる可能性があります。
OpenAIによると、Astraは「重大なサイバー能力」を有する可能性があり、これによりAstra関連およびサイバー領域に特化したワークロードに対する保護策が拡充されることになりました。
一部のトレーニングおよび評価活動は、潜在的に安全でないモデルの挙動による影響を抑制するよう設計された強化型の研究環境へ移行できるようになるまで、停止されたままとなります。
この対応の大きな部分を占めるのが、ワークロードの分離強化です。OpenAIは、モデルが生成したコードやその他の信頼できないコードを実行する環境について、サンドボックス化を強化しています。
その狙いは、侵害されたプロセスや悪意あるペイロード、あるいは予期しないモデルの出力が、機密性の高い社内インフラと接触するのを防ぐことにあります。同社はまた、リスクの高いシステムに対するネットワークセグメンテーションも拡大しています。
こうしたワークロードは公共インターネットや社内ネットワークから切り離されており、あるサービスが侵害された場合でも、それが横方向への移動やより広範な不正アクセスにつながる可能性を低減しています。
OpenAIは、常設の権限を縮小し、外部に露出する可能性のあった共有サービスを撤去したほか、セキュリティログの強化や、模擬攻撃によるインフラ境界の継続的なテストも開始したと述べています。同社はまた、AIシステム自体を活用し、自社のセキュリティ管理体制における弱点の特定にも役立てています。
もう一つの主要な対策が、思考連鎖(chain-of-thought)監視の拡充です。OpenAIは活性化分類器(activation classifier)を用いてサンプリングされたモデルの活動を検査し、セキュリティ制限の回避や接続されたツールの悪用など、懸念される挙動を示すパターンを検出しています。
不審な挙動が検知されると、自動調査システムが利用可能な推論過程、ツールの使用状況、一連の行動を分析します。OpenAIは30分以内にアラートを生成することを目指しています。
さらに30分以内に調査担当者が当該事象が誤検知であるかどうかを判断できない場合、関連する活動は一時停止される見込みです。
この監視フレームワークは現在、Solレベル以上の能力を持つモデルが関わる強化学習トレーニングおよびツール対応型評価に適用されています。Astraツールの利用については、追加の監視要件が課されます。
OpenAIの試算では、これらの保護策により、監視対象ワークロードにおける推論コンピュートの消費量が約20%増加するとしています。
インフラのセキュリティ強化にとどまらず、OpenAIは報酬モデルの改善、欺瞞的な挙動や報酬ハッキングの低減、そしてシステムが自らの能力や行動をより正直に報告するよう促すことを目的に、アライメント研究の拡大にも取り組んでいます。
今回のAstraを巡る判断は、フロンティアAI開発における新たな現実を浮き彫りにしています。高度なAIシステムは、防御的なセキュリティ運用や脆弱性研究、インシデント対応を大幅に改善しうる存在です。
しかしその一方で、同じ能力が高度な攻撃的サイバー活動のハードルを下げる可能性もあり、封じ込め、監視、そして責任あるデプロイこそが、AIセキュリティ戦略の中核をなすことになります。
不審な活動をより迅速に調査し、ビジネスへの影響が拡大する前に脅威を封じ込めるための可視性とコンテキストを、あなたのセキュリティチームに。ANY.RUNで調査能力を強化
翻訳元: https://cyberpress.org/openai-astra-ai-model/