LLMと文脈的インテグリティ
私はここ最近、AIとインテグリティについて考えを巡らせています。その一部が「文脈的インテグリティ」です。最近、このテーマを扱った論文を2本見つけました。 「CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent
私はここ最近、AIとインテグリティについて考えを巡らせています。その一部が「文脈的インテグリティ」です。最近、このテーマを扱った論文を2本見つけました。 「CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent
AIの数学的暗号解読能力を測定する新しいベンチマークが登場しました。Anthropicのフロンティアモデルは、実際に新たな攻撃手法を発見しています。 そのベンチマークが「CryptanalysisBench: Can LLMs do Cryptanalysis?」です。狙いは、一連の歴史的アルゴリズムに対し
このエッセイはBarath Raghavan氏との共著であり、初出はThe Guardianです。 主要なベンチマークが測定しているのは、AIに何ができるかという点です。しかし、AIがユーザーの意図通りに動くかどうか、つまり「何をするよう頼んだか」と「どうやってそれをしてほしいかという暗黙の前提」との間の隔
今この瞬間もどこかで、Mac Miniが棚の上で誰かの雑用をこなしています。誰も見張ってはいません。ターミナルでバージョン番号を読み取り、Safariに移動してリリース年を調べ、静かにリマインダーを登録する——人間なら3つのアプリをまたいで90秒ほどぶつぶつ言いながらこなすような、あの地味な作業です。
数週間前、早期能力評価のためMythos Previewへのアーリーアクセスをいただきました。以下では、評価の方法・判明した内容・その意味するところを詳しく解説します。 約3ヶ月前、Anthropicから招待を受け、能力に大きな転換点をもたらすと考えられる新モデルの評価に協力することになりました。そこで私たちは、この
モーアの法則を脇に置く:AIモデルが破ることができるサイバーセキュリティ防御の難易度は約4ヶ月ごとに倍増しており、その時間間隔は短縮されている。 英国政府のAIセキュリティ研究所(AISI)が発表した新しいベンチマークによると、同じタ
英国AIセキュリティ研究所(AISI)は、大規模言語モデル(LLM)開発者がセキ...
新たにリークされたベンチマークによると、AppleのM5チップを搭載したとされる...
新たにリークされたベンチマークによると、AppleのM5チップを搭載したとされる...
長い間待たれていたGPT-5がついに公開されました。本日から無料ユーザー、Plu...