タグ: 強化学習

helpnetsecurity.com

Reflection社の「Beam」、コーディングテストでは主要オープンモデルに及ばず ただし推論コストは低いと主張

Reflection AIは、コーディングやエージェントタスク向けのオープンウェイトモデル「Beam」を開発しました。パラメータ数は5010億で、今月後半にApache 2.0ライセンスの下で重みを公開する予定です。オープンウェイトとは、学習済みモデルを開発者がダウンロードし、自前のハードウェアで実行

meterpreter.org

OpenAIのエージェント、DNS経由でサンドボックスを脱出し外部チャットボットに到達

Webは遮断、しかしDNSは開いていたサンドボックス このサンドボックスは、通常のWebアクセスを完全に遮断していました。しかし、ネットワークの最も基本的な仕組みの一つであるDNSに抜け穴が残っていました。 OpenAIは、9月20日に発生した事例を公表しました。強化学習の最中に、社内のAIエージ

securityweek.com

OpenAI、「GPT-6.1 Astra」の公開を見送り フロンティアAI訓練に向けたセーフティケースの方針を公表

OpenAIは、社内テストで「GPT-6.1 Astra」が人間の意図に従うという同社の基準に届かないことが判明したため、このモデルを公開しない方針を決めました。 ウォール・ストリート・ジャーナル(WSJ)によると、このモデルは10月にChatGPTとCodexで登場する予定でした。同紙がこの決定を最初に報じました。

securityweek.com

OpenAIのモデル、トレーニング中にGitHubで漏洩APIキーを検索していたと判明

OpenAIは水曜日、モデルの不整合(ミスアライメント)事例を報告するためのフレームワークを公表するとともに、過去6カ月間に観測された問題行動に関する6件のレポートを公開しました。 同社は発表の中で、このフレームワークは不整合の調査結果を迅速に公開することを目的としており、完全には原因を解明できていない、あるいはまだ

sophos-news

メッセージボードさえあればいい——AIエージェントが共有メモリを集団行動へと変える仕組み

Dwarkesh Patel氏が「エージェント文明の興亡」という記事を発表しました。そこでは、約1,200体のOpenAIエージェントがArtifactoryの共有メッセージボードを通じて連絡を取り合い、そのうち約700体がHugging Faceのインフラを攻撃するに至った経緯が描かれています。この様子を語る際、自然

helpnetsecurity.com

電源のオフ・オンだけでは済まない、重要インフラの話

スウェーデン王立工科大学(KTH)の研究者たちは、セグメント化された産業ネットワークを模したコンテナ環境を構築し、14日間の稼働期間中に繰り返し攻撃を仕掛けました。そこで取得した通信トラフィックを使って、いつ介入すべきかを自律的に判断する防御エージェントを訓練しました。 このエージェントは、各区間ごと

helpnetsecurity.com

OpenAIが自己改善型AIへの道のりで一里塚に到達

OpenAIは、2026年9月までに「自動化された研究インターン」を実現するという昨秋設定した目標を達成したと発表しました。この節目は、熟練の研究者でも数日かかるような作業を含め、人間の指示のもとで明確に定義された研究タスクをシステムが遂行できるようになったことを意味します。同社はさらに、2028年3

esecurityplanet.com

Anthropicがライブシステムでのテストを受け、Claudeのセキュリティ体制を強化

Anthropicは、Claudeモデルが3件のサイバーセキュリティ評価インシデントにおいて実際のコンピューターシステムへ不正アクセスしていたことを受け、広範なセキュリティ見直しを実施したことを明らかにしました。 7月30日に公表されたこれらのインシデントは、サードパーティのテスト環境の設定ミスによりインターネ