NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / MODELS
Reflectionが501Bオープンモデル「Beam」を発表 — 23BアクティブMoE、推論効率3〜4倍を主張
米Reflection AIが初のオープンウェイトモデルBeamを2026年10月5日に発表した。総501B・アクティブ23BのスパースMoEでコーディング・推論・エージェント用途に特化し、GLM-5.2級の性能を3〜4分の1の推論計算量で達成したと主張する。重み・技術レポートは10月中の公開予定で、現時点では早期アクセスの受付のみ。
米Reflection AIは2026年10月5日(現地時間)、同社初のオープンウェイトモデル「Beam」を発表した。総パラメーター501B・トークンあたりのアクティブ23BというスパースMixture-of-Experts構成で、コーディング・推論・エージェントワークロードに特化したテキスト専用モデルという位置づけだ。本稿は同社の公式ブログ発表で確認できる範囲に限定して整理する。
モデル概要とベンチマーク公称値
- 構成: スパースMoE、総501Bパラメーター・アクティブ23B。テキスト専用だが、テキスト化された他モダリティの情報は扱えるとしている
- 事前学習: Webとライセンス取得済みデータから厳選した23.8兆トークンで学習し、同規模の公開ベースモデルと同等以上と主張
- ベンチマーク公称値(いずれもベンダー報告): SWE-Bench Verified 80.9、Terminal-Bench 2.1で80.1、SWE-Bench Pro v2-Hard 77.2、AIME 2026で97.8、GPQA Diamond 90.5など
- 他モデルとの比較: GLM-5.2級と競合しQwen 3.8-Maxに迫る一方、Kimi K3など最上位モデルは素の性能で先行していると自ら認めている。DeepSWE v1.1ではBeam 44.4に対しGLM-5.3が61.0、Kimi K3が68.0、DeepSeek V4.1 Flashが74.2と、エージェント系の一部指標では差が開いているものもある。Beamの強みは推論時の効率と位置づけ、GLM-5.2級の性能を3〜4分の1の推論計算量で達成したと主張する。なお他社モデルの数値はArtificial AnalysisとDataCurveの評価を引用したもので、独立した第三者検証ではない
- 効率の根拠: 生成フォワードパスのFLOPを「2×アクティブパラメーター数×生成トークン平均」で近似した試算で、プリフィルや注意機構の文脈依存計算、サービングのオーバーヘッドは除外されている。測定された推論コストそのものではない点に注意が必要

出典: Introducing Beam: Reflection’s 501B open-weight model — Reflection(Figure 2の転載)

出典: Introducing Beam: Reflection’s 501B open-weight model — Reflection(性能比較図の転載)
大規模強化学習とインフラ
- RLの規模: NVIDIA GB300を1.05万基使い4週間で1億超のロールアウトを生成、最大コンテキスト長256Kトークン、学習と採点で約13億のサンドボックスを使用。「オープンな研究組織として過去最大級のRL」と自称する
- 学習手法: 非同期ポリシー勾配を採用し、ポリシーの陳腐化(staleness)や学習系・推論系エンジン間の数値不一致への対策として新しいアルゴリズムを開発したと説明。1日分の陳腐化(107世代前の重み)でも数値的に安定したと主張する
- 環境整備: 最大17万の同時サンドボックス、10億超のサンドボックス生成リクエスト、100万の高品質なコーディング・エージェント・STEM環境を用意。推論障害71件を学習ジョブを止めずに処理し、中央値8分で容量回復したとしている
- 事前学習の安定性: 残差ストリームのRMSは52層すべてで有界に推移し、回復不能な損失スパイクはなかったと報告。チェックポイント改善などにより終盤のgoodput(最終モデルに残った学習ステップの wall-clock 比率)は92.3%に達したという
公開形態と現時点の注意点
- 公開予定: 重み、技術レポート、モデルカード、開発者向け成果物は10月中に公開予定。現時点では最終レッドチーミングと評価の途中で、プラットフォーム上での早期アクセス受付のみ
- ライセンス: ブログ内の記述によればApache 2.0ライセンスでの提供と、実行・評価・ファインチューン用のフルスタック、配信パートナーやOSSライブラリとの統合を予定している
- 用途の実例: NYC地下鉄のライブダッシュボード構築、p5.jsの3Dゲーム生成、Unsloth経由でのGemma-4系モデル向けText2SQLファインチューン用ノートブック作成などのデモを紹介している
- 注意点: 性能数値はすべてベンダー報告または同社が引用した外部評価であり、重み公開前のため独立検証はまだできない。導入判断は重み・技術レポート公開後の第三者評価を待って行うのが妥当