TAG / TOPIC

強化学習

「強化学習」に関するAIニュースと解説記事の一覧です。

04 STORIES

LATEST STORIES

強化学習の新着記事

タグ一覧

MODELS / 01

Reflectionが501B・23BアクティブのMoE「Beam」を発表 — 米オープンウェイトの新鋒、重みは10月中にApache 2.0で公開へ

Reflectionが2026年10月5日に発表したオープンウェイトモデルBeam(501B・23BアクティブMoE)を公式ブログの一次情報から整理する。23.8兆トークンの事前学習、大規模RLの計算規模、ベンチマーク公称値、安全性の取り組み、Apache 2.0での重み公開予定を解説。

RESEARCH / 04

Microsoft ResearchとUIUC、個別生徒を再現するAI「StudentSim」を公開 — 少ない記録から指導に反応する模擬生徒を学習

Microsoft ResearchとUIUCが発表したStudentSimは、少ない学習者データから個別の模擬生徒を学習する枠組み。チェス・英語・数学の評価StudentSimEvalでGPT-5.4を上回り、模擬生徒を報酬モデルにした強化学習で専門家評価の高いチェス指導AIも確認された。

RESEARCH / 04

Inherent、27Bの“AI科学者”エージェント「Faraday」を公開 — Claude Opus 4.8とGPT-5.5を上回る論文再現性能

英Inherent Laboratoriesは2026年8月14日、27BパラメータのAI科学者エージェント「Faraday」を公開した。Qwen3.6-27Bをベースに、100本のML/AI-for-science論文から310の再現タスクで構成される新ベンチマーク「Replica」で長期間の強化学習を実施。論文付随の図を時間・計算資源の制約下で再現するタスクで、Claude Opus 4.8(Claude Codeハーネス)とGPT-5.5(Codexハーネス)を上回る精度を示したと報告。自動生成ルーブリックによるLLMジャッジで報酬を設計し、人手との一致度も検証している。詳細は公式研究ブログとarXiv論文で公開。