要約(3行)
- Reflection が 10/5、同社初の公開モデル「Beam」を発表した。全体5,010億パラメーターのうち、1語ごとに使うのは230億という「MoE」型(専門家を切り替える作り)で、コーディングと、道具を使って自分で仕事を進める用途に力を入れたという。
- 重み(モデル本体)は今月中に Apache 2.0 で公開し、説明書と、動かす・評価する・追加で学習させるための一式も出すと書いている。今は最終の安全確認の途中で、一部の人に先行で使わせる順番待ちの登録を受け付けている。
- 比較の数字はすべて会社自身の測定で、会社も Kimi K3 など上のモデルがあると書いている。会社が強調するのは「同じ答えを出すのに使う計算量が少ない」こと。
今後の使い方の流れ
- まず待つ。 重みの公開は「今月中」とだけ書かれていて、日付は決まっていない。今できるのは、先行利用の順番待ちに登録することだけ。
- 公開されたら、ライセンスと中身を確かめる。 会社は Apache 2.0 と書いているが、公開された重みのページで確かめてから使う。技術レポートとモデルカード(性能・使い方の説明書)も同時に出ると書いている。
- 自分の仕事の題材で試す。 会社の表は、コーディング用の公開試験が中心。自分の使い方に近い題材(社内のコード、文書の整理など)で、小さく試して比べる。
- 動かす場所を決める。 5,010億パラメーターは大きく、動かす機材の条件は発表に書かれていない。会社は「配布の提携先」を用意すると書いているので、自前で動かすか、提携先を使うかは、その発表を待って選ぶ。
この発表で何が変わりそうか(分析)
- 「重みを公開する」と予告した、大きな公開モデル。 全体5,010億・活性230億。Apache 2.0 なら、商用で組み込む条件のハードルは低い。ただし、まだ公開されていない。出してから確かめる話で、今日の時点では予告。
- 会社の売りは「賢さ」より「使う計算量の少なさ」。 会社は、高度な推論の試験で GLM-5.2 と同程度の点を、推論の計算量を3〜4分の1にして出したと書いている。同時に、Kimi K3 のような大きな公開モデルは生の性能で上だと認めている。この計算量の見積もりは、会社が使った出力の長さなどから出した概算(会社の説明)。
- 表を見ると、項目で勝ち負けが分かれる。 会社の表では、SWE-Bench Verified が 80.9、Terminal-Bench v2.1 が 80.1。同じ表で Terminal-Bench v2.1 は GLM-5.2 が 81.0、Kimi K3 が 88.3、DeepSeek V4.1 Flash が 90.6 と、上のモデルが並ぶ。「公開モデルで最強」と読める表ではない。
- 作り方の説明が厚い。 23.8兆トークンで事前学習し、強化学習(やり直しながら上達させる訓練)に、10,500基の GPU を4週間使い、1億回を超える試行を作ったと書いている。公開モデルの作り方を学ぶ資料として読める【推測】。
- 画像は扱わない。 会社は Beam を「テキストだけ」と書いている。画面を見て操作する用途には、別のモデルが要る。
- 中の人の言葉:ブログは会社名義で、署名した個人の発言が無いため、載せない。
出典
- Reflection 公式ブログ「Introducing Beam: Reflection's 501B open-weight model」(2026-10-05)reflection.ai ↗
確認メモ(2026-10-06 に確認):公式ブログの本文(比較の表・安全の説明・「今後」の節)を開いて確かめた。比較の数字と計算量の見積もりは会社自身の測定・概算で、第三者の評価と技術レポートは出ていないため開いていない。重みの公開日、動かすのに必要な機材、API の値段、日本語での性能は、発表に書かれていないため載せていない。


