Google、審査済みの防御担当者向けにガードレールなしの「Gemini 4 Argon」を公開

Googleは水曜日、最先端の新AIモデル「Gemini 4 Argon」を発表しました。当初は「Fairwind Program」を通じて、信頼できる一部のサイバー防御担当者に限定して提供します。

Google社内のチームもこのモデルを利用しています。同社は、早期テスターからのフィードバックを集めながら、段階的に提供範囲を広げるとしています。

Googleによると、Argonはソフトウェアエンジニアリング、法務や財務といった企業のナレッジワーク、サイバーセキュリティ防御における複雑なワークフロー向けに設計されたモデルです。セキュリティ面では、サイバー防御で高い能力を発揮するよう訓練しており、重大なソフトウェア脆弱性を自律的に発見・検証・修正できると説明しています。

同社は「信頼できる防御担当者とGoogle社内のチームには、Argonをサイバー関連のガードレールなしで提供します。これにより、最先端レベルのサイバー防御能力をフルに活用できます」と述べています。

Googleは9月上旬、政府機関、Google Cloudの顧客、サイバーセキュリティ分野のパートナーを対象とする限定アクセスプログラムとして、Fairwindを立ち上げました。当初は「Gemini 3.8 Flash Cyber」モデルと、脆弱性の発見・検証・修正を担うGoogleの「CodeMender」ハーネスを組み合わせた構成でした。開始時点の参加パートナーは650社を超えていました。

Argonが病院向けソフトウェアの欠陥を発見したとGoogleが説明

Googleが今年初めに買収したWizは、重要な公共インフラにおける高リスクの露出を無償で発見・修復する取り組み「Scan for Good」でArgonを活用しています。

Googleは「影響を示す初期の実証として、このモデルは世界中の病院で使われているヘルスケア向けソフトウェアに、機密性の高い個人情報を露出させる重大な脆弱性があることを突き止めました。従来の最先端モデルが見逃していた深刻なリスクを特定したことになります」と説明しています。

ただし発表では、影響を受けるソフトウェア名や、問題が対処済みかどうかには触れていません。

Collinear AIが開発した脆弱性修復のベンチマーク「CWE-bench v1」では、Argonは68%のスコアで首位タイとなりました。OpenAIのGPT-6 Astra、xAIのGrok 4.7と並んでいます。

Googleは、Gemini 3.8 Flash Cyberと比べて脆弱性の発見能力も向上したとしています。Google独自の脆弱性ベンチマークでは、Argonは20種類のプログラミング言語で書かれた複雑なコードベースから、幅広い露出を見つけ出しました。

Wizが独自に用意したブラックボックス型のペネトレーションテスト用ベンチマークは、ソースコードにアクセスできない状態で稼働中のWebシステムを対象とします。このテストでもArgonはGemini 3.8 Flash Cyberを上回りました。Googleによると、攻撃対象領域の発見、脆弱性の特定、概念実証(PoC)の証拠作成のいずれでも優れていたといいます。

広範な公開に向けて安全対策を強化

Googleは「このレベルの最先端能力を安全に公開するには、段階的なアプローチが必要です」と述べています。あわせて、公開前のモデルアクセスに関する米政府の任意のプロセスに参加していることも明らかにしました。

より広い層への提供に向けては、サイバー攻撃や化学・生物・放射性物質・核(CBRN)攻撃につながりかねない要求を拒否するよう、モデルを設計したといいます。一方で、正当な二重用途の科学研究は引き続き支援するとしています。

安全対策には、モデルの内部活性を監視して悪用を察知する技術の改良も含まれます。Googleはまた、Argonを間接的プロンプトインジェクションに対して、これまでで最も耐性の高いモデルと位置づけています。

同社は「Argonがユーザーの意図を超えた方法でタスクを達成しようと、許された範囲を逸脱するのを防ぐため、ミスアラインメント緩和策を導入しています。Argonの思考の連鎖(chain-of-thought)と行動を監視し、必要に応じて実行を停止します」と説明しています。

さらに、リスクの高い訓練や評価を始める前に、サンドボックス環境を隔離して封鎖する対策も講じています。

翻訳元: https://www.securityweek.com/google-launches-gemini-4-argon-with-guardrail-free-access-for-vetted-defenders/

本記事は securityweek.com の記事を翻訳・要約したものです。