評価グラフと実験構造を重ねたAI研究の抽象ビジュアル
NAW / RESEARCH 04

IMAGE: AI生成ビジュアル

RESEARCH / EVALUATION

Qwen3.8-27B、独立評価のArtificial Analysisインテリジェンス指標で52点 — 27BオープンウェイトがGPT-5.6 Luna級に

第三者のベンチマーク機関Artificial Analysisは、Alibaba Qwenの27Bオープンウェイトモデル「Qwen3.8-27B」をインテリジェンス指標で52点と評価した。これはGPT-5.6 Luna(max構成)の52点と並び、GLM-5.2(max)の53点に1点差という水準。9種の評価からなる複合指標で「同規模の比較モデルの中央値(9点)を大きく上回る」としている。一方で評価中の出力は160Mトークンと非常に冗長(中央値43M)で、効率面での課題も示された。

第三者のAIモデル評価機関Artificial Analysisは、Alibaba QwenがApache 2.0で公開した27Bパラメータのオープンウェイトモデル「Qwen3.8-27B」について、同社のインテリジェンス指標(Intelligence Index)で52点と評価した。この指標はコーディング・科学・推論など9種の評価からなる複合スコアで、同指標上ではOpenAIのGPT-5.6 Luna(max構成)の52点と同点、ZhipuのGLM-5.2(max)の53点より1点低い水準に位置する。

27Bオープンウェイトがフロンティア級スコアに並ぶ

  • Artificial Analysisのモデルページは、Qwen3.8-27Bを「同規模の比較モデルの中央値(9点)を大きく上回る」評価としている
  • 52点という数値は、同モデルと同世代のより大規模なモデル(2.4T MoE構成のQwen3.8 Maxなど)とも比較できる水準で、小さい27Bというサイズでありながらフロンティア級のスコアに並んだ点が注目される
  • 特にエージェント系の指標では、複数の解説がGPT-5.6 Terra・GPT-5.6 Luna・GLM-5.2・DeepSeek V4 Flashより上位と伝えている
  • これはQwenチーム自身のモデルカード上の公称ベンチマークではなく、第三者機関による独立評価である点が重要だ

評価の見方 — スコアの高さと「トークン冗長性」のトレードオフ

  • Artificial Analysisは、インテリジェンス指標の評価中にQwen3.8-27Bが 160Mトークンを出力したと報告し、**「非常に冗長(very verbose)」**と表現している
  • 同サイズのオープンウェイトモデルの出力トークン中央値は43Mで、Qwen3.8-27Bはその約3.7倍にあたる
  • つまり高スコアの背後に、同等の質を出すために多くのトークンを消費するトレードオフがあることを示唆しており、API課金やユーザー体験の観点では効率を考慮する必要がある
  • この「スコアの高さ」と「出力の冗長さ」の両面をセットで見るのが、実用上の判断には重要だ

受け止め — 小規模オープンウェイトの実力と効率の検証

  • Qwen3.8-27Bはコンシューマー向けGPUでローカル実行できるサイズで、**「ローカルでフロンティア級のエージェント・コーディング性能」**を期待させる評価として複数のメディアが報じている
  • ただし本記事の数値はすべてArtificial Analysisの評価(一次情報)および同指標のデータに基づくもので、個別タスクでの実際の性能や実運用でのコスト・スループットは、利用者が自身の環境で確認する必要がある
  • 27B級のオープンウェイトモデルが巨大モデルと匹敵するスコアを出しつつトークン効率が課題になる、という構図は、オープンウェイトモデルの性能評価を巡る「スコア偏重」議論にも材料を与える

出典: