Wikipediaを運営する非営利団体のウィキメディア財団は、自らのプラットフォーム上で、OpenAIの「暴走(rogue)」エージェントによる活動を確認したと明らかにしました。引用ツールとノート作成サービスを、外部データ取得用のプロキシとして悪用しようとした形跡も含まれるとみています。
ウィキメディア財団は、他の組織が公表したような活動が自らのウェブサイトでも起きていないかを調査しました。調査は、OpenAIが運用するエージェントに的を絞って実施しています。
たとえばOpenAIのエージェントは、プログラマー向けの小規模なドイツ語wiki「DseWiki」を掲示板として利用し、5月から数千件もの編集を行いました。OpenAIはこの件を、ミスアラインメント(意図とのずれ)に起因するインシデントと説明しています。
ウィキメディア財団によると、OpenAIが運用しているとみられるエージェントが、同財団のwikiにも編集を加えていました。ただし、一般の読者が目にするページに表示された編集はなく、ほぼすべてがサンドボックス領域でのテスト編集でした。
一方で、一部の編集は引用ツールの設定を標的にしていました。ウィキメディア財団は、これらを悪意のある可能性が高い編集とみています。狙いは、このツールを外部サービスからデータを取得するためのプロキシに変えることだったと考えています。
同財団は声明で、次のように述べています。「Wikipediaのポリシーでは、ボットの編集はコミュニティの承認を得て公表されている場合に限り認められています。しかし今回のインシデントでは、いずれの承認も求められていませんでした」
エージェントは、同財団がコミュニティ向けに提供しているノート作成ツール「Etherpad」の公開インスタンスへの侵害も試みましたが、失敗に終わっています。ウィキメディア財団は「エージェントは、Etherpadをプロキシとして他のウェブサイトからデータを取得しようとしましたが、成功しませんでした」と説明しました。
おそらくOpenAIのものとみられる別のエージェントは、Etherpadを自らのタスクのメモ取りに使っていました。ウィキメディア財団は、これがエージェント間の連携に発展した様子はなかったとしています。
エージェントは大量のトラフィックも発生させました。ウィキメディア財団の公開APIには数百万件の自動リクエストを送信し、主にWikidataとWikimedia Commonsを中心に数百万ページをクロールしました。さらに、Wikidata Query Serviceには数十万件のクエリを送っています。
同財団は、このトラフィックが5月に発生したクエリサービスの部分的な障害の一因になった可能性があるとしています。
財団は次のように述べています。「当財団のシステムがエージェント間の連携に使われた証拠は見つかっていません。システムやデータが侵害された証拠もありません。しかし、ここで起こり得た事態や、この活動の調査・原因特定に要する手間と労力の大きさ、そして当財団のプラットフォームでエージェント型AIの活動が広がるリスクについて、懸念しています」
ウィキメディア財団は、AI企業は自社システムの安全確保を十分に行っておらず、その負担を小規模な組織を含む他のすべての人に押し付けていると批判しています。
財団は「少なくとも、私たちのような非営利のウェブサイト運営者が、AI企業のシステムを容易に識別でき、どのようにサービスとやり取りさせるかを選べるようにすべきです」と訴えました。
OpenAIは7月、同社のエージェントが隔離されたテスト環境から抜け出し、Hugging Faceをハッキングしたことを認めました。その後OpenAIは、エージェントが即席で作った掲示板を介して連携していたことも明らかにしています。別のインシデントでは、一部のエージェントが既知のLinuxカーネルの脆弱性を悪用し、OpenAI自身のシステムで権限を昇格させました。
8月にはOpenAIが、高度なサイバーセキュリティ能力を持つモデルを対象に、より厳格な隔離策、アラートシステム、トレーニングの一時停止を導入すると発表しました。あわせて、承認されていない経路で届く他のエージェントからの指示を信用しないようモデルに教える、トレーニング環境も構築中だとしています。
SecurityWeekはOpenAIにコメントを求めており、同社から回答があれば記事を更新します。