音響キーストローク攻撃、言語モデルでタイピング内容を解読

キーボードを打つ音の反響には、これまで想像されていた以上の情報が含まれていることが分かりました。最近発表されたある新しいサイドチャネル攻撃は、標的となるマシンを直接侵害することなく、短い音声録音だけで入力されたテキストを再構築できることを実証しています。東北大学、京都大学、奈良先端科学技術大学院大学の研究者たちが、高度な音響解析と言語モデルを組み合わせてキーストロークを解読する、この精巧な仕組みを開発しました。

従来の音響攻撃の限界を克服

従来の音響攻撃は事前のキャリブレーションを必要とし、研究者は標的となるキーボードの一つ一つのキーについて、その音響的な特徴をあらかじめ記録しておく必要がありました。これに対し、この画期的な手法は事前の学習を必要としません。システムは生の音声ストリームから個々のキーストロークを自動的に切り出し、音響的に似た音のパターンをクラスタリングした上で、文脈上の確率に基づいて最も可能性の高い文字列を予測します。

高い翻訳精度を実現するため、研究者たちはTransformerベースの言語モデルに大規模言語モデル(LLM)のフレームワークを組み合わせて活用しました。キーボードの音響盗聴に関する研究論文で詳述されているように、この仕組みは推定されたテキストを繰り返し精緻化し、個々の音響信号を周囲の語彙的文脈と照らし合わせて評価することで誤りを修正していきます。そのため、この攻撃は個々のキー同士のわずかな物理的差異のみに依存するものではありません。

実験によるベンチマークと現実世界での盗聴

制御された実験環境では、2019年モデルのMacBook Proのそばにスマートフォンを置き、周囲のタイピング音を録音しました。わずか100回から150回のキーストロークを録音しただけで、システムは99%を超える驚異的な精度でタイプされたテキストを再構築しました。さらに、この手法はDell、HP、Lenovo、Appleなど様々なノートパソコンの機種でも有効であることが判明しましたが、一部の機種ではやや多めの音声サンプルが必要でした。

より複雑な実験シナリオでも、150回から250回のキーストロークを録音した後で90%を超える精度が示されました。研究者たちは、デスクを挟んで約3メートル離れた場所に設置したコンタクトマイクを使って機械的な振動を捉えることに成功し、さらには隣接する壁越しでも同様の結果を得ています。ただし、著者らはこれらの実験があくまで学術的な実証であり、一般消費者を標的とした実際の悪用事例ではない点を強調しています。

ビデオ会議における脆弱性と対策

さらに研究者たちは、Google Meet、Microsoft Teams、Zoomでのビデオ会議中における攻撃の有効性についても評価を行いました。参加者が標準搭載のノイズ抑制機能を無効にしていた場合、キーストロークの音響的特徴が音声ストリーム内に残存し、数百回分のキーストロークを録音した後にテキストの再構築が可能になりました。全体的な成功率は、使用しているノートパソコンのハードウェアやコミュニケーションプラットフォームのアルゴリズムによって異なりました。

音響盗聴による被害を最小限に抑えるため、セキュリティ専門家はマイクが有効になっている状態でパスワードや機密性の高い認証情報を入力しないよう推奨しています。加えて、ユーザーは常にAIによるノイズ抑制機能を有効にし、周囲にあるスマートフォンや外部マイク、録音機器にも注意を払うべきだとしています。

翻訳元: https://meterpreter.org/acoustic-keystroke-attack/

ソース: meterpreter.org