Reflection AIは、コーディングやエージェントタスク向けのオープンウェイトモデル「Beam」を開発しました。パラメータ数は5010億で、今月後半にApache 2.0ライセンスの下で重みを公開する予定です。オープンウェイトとは、学習済みモデルを開発者がダウンロードし、自前のハードウェアで実行できることを指します。Beamはmixture-of-experts(MoE)設計を採用しており、1トークンあたりに動作するパラメータは230億にとどまります。そのため、回答1件あたりのコストを抑えられます。

Beamは、素のスコアではオープンモデルの首位に立っていません。コマンドライン作業を測るTerminal Bench v2.1では、Beamのスコアは80.1でした。これに対し、GLM 5.2は81.0、Kimi K3は88.3、DeepSeek V4.1 Flashは90.6です。DeepSWE v1.1ではBeamが44.4を記録し、GLM 5.2の44.0をわずかに上回りましたが、DeepSeek V4.1 Flashには29.8ポイントの差をつけられました。Reflectionは説明しています。高度な推論ベンチマークでBeamはGLM 5.2と同等のスコアを出しながら、推論に必要な計算量は3分の1から4分の1で済むとのことです。
ただし、この計算量の数値はあくまで目安として扱うべきです。Reflectionは「アクティブパラメータ数の2倍×生成トークン数の平均」という式で見積もっており、結果は計算量の概算比較であって、推論コストそのものを示すものではないとしています。この式には、プロンプト処理、アテンションのコスト、サービング時のオーバーヘッドが含まれていません。競合モデルのスコアは、Artificial AnalysisとDataCurveから取得しました。エージェントを24時間稼働させる場合、実際のコストはプロンプトやハードウェアによって変わります。その検証は利用者自身で行う必要があります。
学習はまだ頭打ちになっていなかった
Reflectionは4週間にわたり強化学習を実施しました。強化学習とは、モデルがタスクに挑戦して採点を受けることで性能を高める段階です。この学習には約10,500基のNVIDIA GB300 GPUを使用しました。試行回数は1億回を超え、ほぼ100万の学習環境を活用し、学習と採点に約13億のサンドボックスを投入しています。同社によると、学習を終えた時点でもスコアは上昇を続けていました。
Beamが学んだ内容の一部は、学習タスクの枠を超えて広がりました。ブラウジングを含まないタスク構成のフェーズでも、ブラウジングのスコアが向上しています。また、Webアクセスを与えると、ほかの大規模言語モデルを検索して問い合わせたり、OCRサービスを呼び出して文書を読み取ったりするようになりました。エージェントとしては有用な挙動です。一方で、Beamにネットワークアクセスを与える前に、ログを取得しておくべき挙動でもあります。
安全性の結果は後日公開
Beamは現在、最終段階のレッドチーミングと評価の途中にあります。Reflectionは、同じ初期チェックポイントから安全性とアラインメント用のモデルを別に学習させ、蒸留で2つを統合しました。蒸留とは、あるモデルに他のモデルを模倣させる学習手法です。同社は、重みの公開に合わせて技術レポートを発表し、安全性の結果を掲載する予定です。社内で構築した安全性テストもオープンソース化するとしています。アーリーアクセスは、限定されたユーザーを対象にしたウェイトリスト経由で提供されます。