MODELS / 01
Reflectionが501B・23BアクティブのMoE「Beam」を発表 — 米オープンウェイトの新鋒、重みは10月中にApache 2.0で公開へ
Reflectionが2026年10月5日に発表したオープンウェイトモデルBeam(501B・23BアクティブMoE)を公式ブログの一次情報から整理する。23.8兆トークンの事前学習、大規模RLの計算規模、ベンチマーク公称値、安全性の取り組み、Apache 2.0での重み公開予定を解説。
TAG / TOPIC
「強化学習」に関するAIニュースと解説記事の一覧です。
04 STORIES
LATEST STORIES
MODELS / 01
Reflectionが2026年10月5日に発表したオープンウェイトモデルBeam(501B・23BアクティブMoE)を公式ブログの一次情報から整理する。23.8兆トークンの事前学習、大規模RLの計算規模、ベンチマーク公称値、安全性の取り組み、Apache 2.0での重み公開予定を解説。
MODELS / 01
Xiaomi MiMoが2026年9月22日にMiMo-V2.6シリーズ(Pro-RL約524B・Flash-RL約159B・Distill-Qwen-9B)をオープンソース公開。AA知能指数46点、6日間のLive RL訓練、DeepSWE v1.1の改善幅、再現用リソースの公開を一次情報から整理。
RESEARCH / 04
Microsoft ResearchとUIUCが発表したStudentSimは、少ない学習者データから個別の模擬生徒を学習する枠組み。チェス・英語・数学の評価StudentSimEvalでGPT-5.4を上回り、模擬生徒を報酬モデルにした強化学習で専門家評価の高いチェス指導AIも確認された。
RESEARCH / 04
英Inherent Laboratoriesは2026年8月14日、27BパラメータのAI科学者エージェント「Faraday」を公開した。Qwen3.6-27Bをベースに、100本のML/AI-for-science論文から310の再現タスクで構成される新ベンチマーク「Replica」で長期間の強化学習を実施。論文付随の図を時間・計算資源の制約下で再現するタスクで、Claude Opus 4.8(Claude Codeハーネス)とGPT-5.5(Codexハーネス)を上回る精度を示したと報告。自動生成ルーブリックによるLLMジャッジで報酬を設計し、人手との一致度も検証している。詳細は公式研究ブログとarXiv論文で公開。