- プライバシーポリシーが読みにくいことで有名なのは今に始まったことではないが、LLM(大規模言語モデル)の世界ではその難解さと長さが際立つ
- MetaのMuse Sparkのポリシーは14,000語を超え、読み終えるのに1時間近くかかる
- サイバーセキュリティ企業Bridewellが人気LLM20製品のプライバシーポリシーを調査した
AIチャットボットにデータを入力すると、その言葉や数値を解釈・処理して時間を節約してくれると期待するものです。しかし、そのデータは実際にはどのように扱われているのでしょうか。プライバシーポリシーを確認すれば分かりますが、それはあくまで確認する時間がある場合の話です。
新たな調査により、LLMのプライバシーポリシーを読むのにかかる平均時間は20分にのぼり、中にはさらに長いものもあることが明らかになりました。
約75%の人が少なくとも月に1回はAIチャットボットを利用していると回答している中、自分の質問やデータがどこへ送られ、どのように使われているのかを理解しておくことの重要性はますます高まっています。
読みやすさ
プライバシーポリシーはこうした理解を提供するためのものですが、果たして読みやすいのでしょうか。Bridewellのサイバーセキュリティ専門家による調査によれば、答えは「否」です。多くのポリシーがフレッシュ読みやすさスコアで低い評価となっており、平たく言えばこれらの文書はかなり難解だということです。
Bridewellの調査では、20の大規模言語モデル(LLM)のプライバシーポリシーが評価され、読了までの平均時間は20分に及ぶことが判明しました。平均語数は4,603語ですが、真の課題はその内容を理解することにあります。
フレッシュ読みやすさスコアは、1948年にRudolf Flesch氏が考案した読みやすさの指標で、テキストの評価に広く用いられています。スコアが60を超えれば良好とされ、それを下回ると読みにくいとされます。これらのプライバシーポリシーの平均フレッシュスコアは40.2で、専門用語が密に詰め込まれ、大半の人には理解しづらい水準であることがうかがえます。
では、一般の人々はChatGPTやGoogle GeminiのようなLLMチャットボットを、入力した情報がどのように使われるかを十分に理解した上で、安全に利用するにはどうすればよいのでしょうか。
入力データによるトレーニング
Bridewellが各LLMを評価した結果、20製品のうち13製品が入力データと出力データをモデルのトレーニングに利用していることが分かりました。トレーニングへの利用をオプトアウトできるLLMもありますが、そうでないものもあります。オプトアウトが可能な場合でも、その手順が常に明確とは限りません。
Bridewellのデータプライバシー担当ディレクターであるChris Linnell氏は次のように述べています。「ユーザーは自分のデータがLLMによってどのように処理されているかを十分に理解する必要があります。また企業側も、何を共有してよく何を共有してはいけないかについて明確な社内ガイドラインを整備し、理想的には適切な保護措置が講じられたエンタープライズアカウントを用意すべきです。従業員は、極めて機密性の高い情報や社外秘の情報を共有してしまい、それがLLMのトレーニングに使われてしまうリスクにさらされている可能性があります」
AIへのデータ入力に伴うリスクは、個人だけの問題ではありません。従業員は、業務でこの技術をどのように利用しているかを認識しておく必要があります。
大まかな傾向として、LLMが複雑になるほど(例えばMetaのMuse SparkやMoonshot AIのKimi Kなど)、プライバシーポリシーを読むのに要する時間も長くなる傾向があります。