OpenAIのAstra AIモデル、重大なサイバー能力の閾値に到達する可能性
OpenAIは、社内テストにおいて次期モデル「Astra」がサイバーセキュリティ分野で重大な能力の閾値に近づく可能性があることが示されたとして、フロンティアAIのトレーニングを一時的に減速させました。 今回の決定は、能力を増し続けるAIシステムが、人間による限られた指示のもとでソフトウェアの脆弱性を自律的に特定・分析
OpenAIは、社内テストにおいて次期モデル「Astra」がサイバーセキュリティ分野で重大な能力の閾値に近づく可能性があることが示されたとして、フロンティアAIのトレーニングを一時的に減速させました。 今回の決定は、能力を増し続けるAIシステムが、人間による限られた指示のもとでソフトウェアの脆弱性を自律的に特定・分析
OpenAIは、初期テストにより次期システム「Astra」が同社の定めるサイバーセキュリティ能力の「Critical(重大)」しきい値に達する可能性が示されたことを受け、最新のフロンティアAIモデルの開発を一時的に減速させました。 この決定は、OpenAIとHugging Faceが関わった最近のセキュリティインシデ
OpenAIは、高度なサイバーセキュリティ能力を持つモデルを管理するため、より厳格な隔離とトークン検査システムを導入し、AI研究における新たな封じ込め・継続的監視プロトコルの詳細を明らかにしました。 これらのセキュリティ対策は、次期モデルであるAstraが、同社のPreparedness Framework(準備態勢
アナリストらは、今回の一連の対応はIPOを見据えた単なるポジショニングにすぎない可能性があると指摘する一方、いずれの変更も歓迎すべきニュースだとしています。 OpenAIは今週、自社のセキュリティおよびプライバシーに対する
OpenAIは、「アストラ」がサイバー分野における重大な閾値に近づいていることを受け、フロンティアAIの学習を減速させています。この動きは、AIのセキュリティ、自律性、防御をめぐる新たな課題を浮き彫りにしています。 eSecurity Planet の記事および製品に関する推奨事項は、編集上の独立性を保っ
先日発生したHugging Faceの事件を受け、OpenAIはAI安全対策の強化に向けた取り組みを急いでいると発表しました。この事件では、OpenAIのモデルがタスク実行中に暴走し、オープンソースプラットフォームであるHugging Faceを標的にする事態が発生していました。 同社は8月18日に公開した更新
OpenAIは、展開予定の最新モデルに対する強化学習(RL)トレーニングを2週間にわたり一時的に停止し、その間に研究環境の強化とレッドチーム演習を実施するとともに、監視体制を拡充しました。 同社は「当社が計画している最大規模のフロンティアRLランは、モデルの挙動を評価し、安全対策を検証し、実施前にア
AI・機械学習 思考過程(chain of thought)の多段階監視を拡張し、フロンティアモデルの運用コストが上昇
私はここ最近、AIとインテグリティについて考えを巡らせています。その一部が「文脈的インテグリティ」です。最近、このテーマを扱った論文を2本見つけました。 「CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent
OpenAIは、AIエージェントにおけるプロンプトインジェクションの弱点を特定・悪用するよう訓練された自動安全性レッドチーミングモデル「GPT-Red」を発表しました。Hacking& Cracking プロンプトインジェクションとは、Webページ、メール、ローカルファイル、コードリポジトリ、ツールの出力など
すべての記事を読み込みました