IMAGE: AI生成ビジュアル
RESEARCH / RESEARCH
Hugging Face「State of Open Models」夏版 — 中国ラボがフロンティアの主役に、Qwenは事実上の標準基盤へ
2026年1〜7月のHubデータに基づく生態系分析。中国ラボの月間最大モデルは754B〜2.78Tパラメータに達し米国を上回る一方、ダウンロードの83%は1B未満の小型モデルが占める。「注目」と「採用」が乖離し、Qwen派生は15万件超でLlama系の4.7倍に。エージェントが新たな主要ユーザーになったとする観察も。
Hugging Faceは2026年8月14日、半年に一度のオープンモデル生態系レポート「State of Open Models: Summer 2026 Observations」を公開した。2026年1〜7月にHub上で観測されたデータ(モデルリポジトリ243万→296万、データセット71.1万→100万、Spaces 100万→144万)を基に、フロンティアの重心移動やライセンス戦略、エージェントの台頭を6つの観察としてまとめている。本記事では、その主要な数字と主張を一次情報に基づいて整理する。
フロンティアの重心は中国へ — 米国はハードウェア企業が主役に
レポートが最初に指摘するのは、オープンモデルの「最大級モデル」を巡る勢力図の変化だ。
- 2026年はほぼ全ての月で、中国ラボが公開した最大かつ最強のオープンモデルが米国ラボのものを上回った。中国側の月間上限は754B〜2.78Tパラメータ
- 米国側の月間上限は7ヶ月中5ヶ月で130B未満。例外はNVIDIAの「Nemotron 3 Ultra」(561B、5〜6月)とThinking Machines Labの「Inkling」(952B)
- 小米(Xiaomi)と美团(Meituan)が今年1Tパラメータ超えを達成し、1年前にはオープンウェイト界で無名だった企業が大型化競争に参入
- 一方、米国で最も多く新モデルを公開しているのはAMDとNVIDIA(各200リポジトリ超)、3位はLiquidAI(約100)。オープンモデルの発行主体は「モデルラボからハードウェア・インフラ企業へ」移ったと分析する
- 100B超の米国リリースの多くは中国モデルを土台にした派生であり、オリジナルの大型モデルはInkling、Nemotron 3 Ultra/Super、Arcee AIのTrinity-Large(399B)など少数にとどまる
「注目」と「採用」は別の経済圏 — 実務層は依然として小型モデル
レポートが「最もよくある誤解」として強調するのが、Likes(注目)とダウンロード(採用)の乖離だ。
- 2026年のダウンロード上位25とLikes上位25の重複はわずか1件。Likesは公開直後のフロンティアモデルに集まり、ダウンロードは長期間パイプラインに組み込まれた小型・安定モデルに蓄積する
- 2026年公開のモデルはダウンロード上位25に1件も入らず、上位25のうち13件は2022年公開。all-MiniLM-L6-v2は7ヶ月で15.5億ダウンロード(Likesは5,156)だった
- パラメータ数が判明しているモデルに限ると、**1B未満が全期間ダウンロードの83%**を占め、100B超は1%。2026年のダウンロードに限っても70B超は3%にとどまる
- ただし「フロンティアだけ」で戦う戦略も成立しつつある。llama.cppのGGUF対応により、DeepSeek-V4-Flash(約284B)やKimi-K3(約2.8T)を複数のコンシューマー機で分散実行できるようになり、大型モデルをローカルで届ける経路が生まれた
ライセンスはビジネスモデルではない — 価値はAPIとエコシステムへ
フロンティアモデルがライセンス収入を目的とするなら、最大級のリリースほど厳しい条項が付くはずだ。データはその逆を示すという。
- 20B超の中国リリース178件のうち、59%がApache 2.0、22%がMITで、非商用制限はゼロと集計された(Hugging Faceの分析。なお、この集計にはコミュニティから異論も出ており、MoonshotのKimi K3は大規模なMaaS事業者に別途契約を求める条項があるとの指摘がある)
- 同じサイズ帯の米国側は、Apache 2.0/MITが29%、独自条項が41%、未宣言が30%
- DeepSeekやZ.aiは7,000億〜1.65Tパラメータのモデルを素のMITで公開。レポートは「こうしたリリースの狙いはライセンス収入ではなく、API・クラウド・ハードウェア・エコシステム上の位置取りだ」と解釈する
Qwenがコミュニティの「基盤モデル」に
派生モデルの数で見ると、Qwenが事実上の標準基盤になりつつある。
- Qwenベースの派生モデルは15万1,448件で、Meta全体の2.6倍、Llama系リポジトリの4.7倍。Googleは8万2,506件で2位
- 2026年の最初の7ヶ月で1日あたり約180〜210件のペースで増加。その多くはQwen自身ではなくコミュニティによる派生で、GGUF変換2万8,531件のうちQwen公式は54件のみ
- GGUFダウンロードも月間3,960万回と、Gemma(2,080万)の約2倍、Llama(750万)の5倍超
- 実行レイヤーの成長はモデル本体を上回る。ggufライブラリを宣言するリポジトリは464%増、lerobotは194%増、Appleのmlxは148%増(transformersは16%増)
エージェントが新たな主要ユーザーに
7月に公開されたagent-usageデータセットにより、コーディングエージェントがHubを呼び出すトラフィックが初めて可視化された。
- 7月のエージェントトラフィックの44.4%はClaude Code由来。ただし4月は67.8%、5月は6.4%と月ごとの変動が激しく、「1つのリリースやデフォルト変更で半分のトラフィックが動く、既存勢力のいない市場」と分析する
- Codexは10.4%から20.8%へ着実にシェアを伸ばした
- データセット未登録のハーネスが7月に約4分の1(5月は59.8%)を占め、新規参入がレジストリの命名速度を上回っている
- レポートは7月にHugging Faceが開示した自律エージェントによる持続的侵入の事例にも触れ、「エージェントは読者から侵入者になった」と総括している
半年間のデータは、オープンモデルの重心が中国ラボとハードウェア企業に移り、実務での採用は依然として小型モデルに集中する構図を浮かび上がらせる。Hugging Faceは「数ヶ月で生態系は塗り替わる。次回レポートではエージェントが最大のユーザーになっているかもしれない」と結んでいる。
出典: Hugging Face Blog「State of Open Models: Summer 2026 Observations」、同記事のGitHubソース