青い光を帯びた多層ニューラルネットワークの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / MODELS

Xiaomi MiMoが「MiMo-V2.6」シリーズを公開・オープンソース化 — ProがAA知能指数46点、RLの全工程も再現可能に

XiaomiのMiMoチームは2026年9月22日、大規模強化学習で鍛えた「MiMo-V2.6」シリーズ(Pro / Flash / Distill-Qwen-9B)をオープンソースとして公開した。ベンダー発表によればProはArtificial Analysis Intelligence Indexで46点を獲得し、Kimi K3やQwen3.8 Maxを上回る公開モデル最上位としている。技術レポート・学習環境・RLコードも同時公開され、第三者が再現・検証できる構成になっている。

XiaomiのMiMoチームは2026年9月22日、公式ドキュメントのニュース欄で**「MiMo-V2.6」シリーズの正式リリースとオープンソース化**を発表した。検証可能な複雑タスクを土台に強化学習(RL)の計算量を拡張し、反復的な探索とフィードバックで知能の境界を広げる「再帰的自己改善(RSI)」路線の一歩と位置づけている。重みはHugging Faceの公式コレクションで公開済みである。

シリーズ構成 — Pro / Flash / Distill-Qwen-9Bの3モデル

  • 2つのネイティブ・フルマルチモーダルモデル: シリーズの中核は Pro と Flash。コード・汎用・視覚・サイバーなど複数分野のマルチタスク訓練体系で学習されている。
  • Hugging Faceでの公開実態(HF APIで確認): コレクション XiaomiMiMo/mimo-v26 に3リポジトリが登録され、2026年9月21日付で更新されている。MiMo-V2.6-Pro-RL(約524Bパラメータ)、MiMo-V2.6-Flash-RL(約159Bパラメータ)、MiMo-V2.6-Distill-Qwen-9B(約9.4Bパラメータ、image-text-to-text)。
  • 蒸留モデル: Distill-Qwen-9B はRL軌跡からの蒸留モデルで、SFTベースラインに対する改善が11ベンチマーク全体で確認されたとしている(ベンダー発表)。
  • API: V2.5シリーズと同一価格を維持。ProにはOpen Platform上で最大20倍の推論速度をうたう UltraSpeedモード が用意されている。

性能の主張 — AA指数46点とエージェント系ベンチマーク

  • Artificial Analysis Intelligence Index: ベンダー発表によれば MiMo-V2.6-Proは46点 を獲得し、Kimi K3とQwen3.8 Maxを上回って「現時点で最強のオープンソースモデル」としている。一方、最強のクローズドモデルであるClaude Fable 5.1とGPT-6 Astraとは依然ギャップがあることも明記している(いずれもベンダー公称値であり、独立評価ではない)。
  • エージェント系ベンチマーク: 大規模マルチタスクRLの結果、Proは大半のエージェントベンチマークで Claude Opus 5やGPT-5.6 Solに匹敵 し、FlashはMiMo-V2.5-Proを全面的に上回ったとしている(ベンダー発表)。
  • 分布外汎化の指標: 長距離ソフトウェア工学の評価基準 DeepSWE v1.1 で、Flashは約48.8→65.7(約17点改善)、Proは約58.4→72.6(約14点改善)としている(ベンダー発表)。

MiMo-V2.6-ProのArtificial Analysis Intelligence Indexにおける他モデルとの性能比較チャート(ベンダー公開図)

出典: MiMo-V2.6: Scaling Up Reinforcement Learning for Self-Improvement — Xiaomi MiMo

RL訓練の中身 — 6日間の公開訓練と再現用リソース

  • 公開Live訓練: FlashとProはそれぞれ30ステップ、累計約75万trajectoryを6日弱で実行。訓練費用はFlash約85万ドル、Pro約262万ドルと開示されている。
  • スケール拡張の3軸: (1) 大バッチ・完全非同期(更新あたり1,568サンプル、1Mコンテキスト、ステップあたり3.5〜3.7Bトークン)、(2) 多タスク・複雑環境(複数Harness統合)、(3) Grader計算量の拡充(Group内相対比較による報酬信号)。
  • 安定化の工夫: MoEルーターの凍結によるエキスパート負荷ドリフト抑制、報酬設計・敵対的評価・異常検知・検証器の相互検証を含むReward Hacking対策、マルチエージェントRL向けの統一trajectory表現とペナルティ機構。
  • 再現性の確保: 技術レポート全文、訓練環境、RLコード、システムプロンプト・ツール・コンテキスト管理を分離したミニマルなmini-harnessをオープンソース化し、第三者が再現・検証できる形にしている。
  • 応用機能: 3D空間推論・マルチモーダル知覚・コンピュータ操作(CUA)を統合し、3Dオープンワールドゲーム生成、Blenderでの3Dモデリング、具身シミュレーション環境での多視点カメラ入力による制御、デザイン評価のDesign Arena(ProがClaude Opus 5・GPT-5.6 Sol級と主張)などを挙げている。

出典