フロンティアAI企業のModulateは、Future Venturesから新たに2,500万ドルの資金を調達しました。Hyperplaneとされる Lakestarも参加し、累計調達額は6,000万ドルに達しました。Modulateは、人間の会話に含まれる微妙なニュアンスを、本物か偽物かを問わず機械が理解できるようにする、音声ネイティブのAIモデルを開発しています。
同社は独自の「Ensemble Listening Model(ELM)」アーキテクチャを用いて、個別のAIモデルを生成しています。これらのモデルが、同社のプラットフォーム「Velma」を支えています。Velmaは100以上の専門モデルを統合しており、感情、口調、意図、合成音声、会話上の振る舞いといったシグナルを理解・検出します。
同社は現在、毎月1,000万時間以上の音声を分析しており、累計の分析時間は6億時間を超えています。Modulateによると、同社の文字起こしモデルとディープフェイク検出モデルはいずれも、Hugging Faceなどの公開ベンチマークで1位を獲得しています。
Modulateは、音声を生成するのではなく、AIで音声を分析することに注力しています。同社によると、Velmaの結果は従来の大規模言語モデル(LLM)の2倍の精度を誇り、誤検知は7分の1に抑えられるといいます。Velmaはリアルタイムで動作するため、これを使って構築したアプリケーションは、状況を理解するだけでなく、事態が進行している最中に介入することもできます。
主な用途は次のとおりです。医療機関をディープフェイクによるハッカーから守る、音声AIエージェントの感情表現や共感力を高める、ソーシャルプラットフォーム上の過激主義や嫌がらせを減らす、音声エージェントの性能を観察・監視する、児童へのグルーミングを行う音声会話を検出して阻止する、高度な音声マスキングによって高リスクの場面にいるエージェントの身元が特定されるのを防ぐ、といったものです。
「音声はAIの主要なインターフェースになりつつあり、それによって、文字起こしだけでは解決できない新たな問題が生まれています」と、Modulateの共同創業者兼CEOのCarter Huffman氏は説明します。「当社はすでに、音声ネイティブのAIを使って、組織をディープフェイク攻撃から守り、音声エージェントが感情を理解してより共感的に応答できるよう支援し、オンライン会話に潜む危険な行動を特定し、音声エージェントが本来の想定どおりに機能しているかどうかを監視しています」
今回の資金は、Modulateのチームとインフラの拡充に充てられます。あわせて、音声アプリケーションを構築する開発者やパートナー向けに提供するモデル、API、SDK、統合機能、導入オプションを拡大します。同時に、自社の基盤となる研究と技術への投資も続けます。
AIを悪用した詐欺的なディープフェイクや、言葉の単純な悪用による誹謗中傷は、もはや日常の現実となっています。被害が出る前にディープフェイクを検出し、悪意ある言動を見抜くことは、AIなしにはほぼ不可能です。しかも、音声の悪用を検出できるアプリケーションを構築するのは容易ではありません。Modulateは、その支援を目的としています。
「新しい音声体験を作るたびに、開発者が音声インテリジェンス層をゼロから作り直す必要があってはなりません」とHuffman氏は付け加えます。「当社の使命は、開発者が作りたいアプリケーションに集中できるよう、モデルとインフラを提供することです。音声ネイティブAIを取り巻くチャンスは、驚くほどの速さで広がっています。当社はその技術を構築し、大規模な運用で実証してきました。今回の投資により、チームを拡大し、より迅速にその需要に応えられます」
翻訳元: https://www.securityweek.com/modulate-raises-25-million-to-advance-deepfake-detection/