青い光を帯びた多層ニューラルネットワークの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / MODEL WATCH

Z.ai、「GLM-5.3」を公開 — コーディング50%改善と「創発したサイバー能力」、重みは約2週間後に公開予定

GLM-5.2と同じベースモデルで、改善はすべて事後学習によるもの。社内ベンチ「Z.ai Code Bench」で50%改善、Terminal Bench 3.0で4.6→28.3、CyberGymで84.5%と比較対象中最良を記録したと発表。脆弱性発見能力の急速な発達を受け、重みの公開は安全性評価・ハードニング完了後の約2週間後としている。

Z.ai(Zhipu AI)は2026年8月14日、コーディング特化モデル「GLM-5.3」を公開した。ブログ記事のタイトルは「GLM-5.3: Frontier Coding with Emergent Cyber Capabilities」で、コーディング性能の大幅な向上に加え、事後学習の過程で脆弱性発見・悪用(exploitation)の能力が想定以上に発達した「創発的サイバー能力」を前面に打ち出している。GLM-5.2と同じベースモデルを使っており、すべての改善は事後学習によるものだと説明されている。モデルはAPIとGLM Coding Planで即日利用できる一方、重みの公開は安全性評価・ハードニング完了後の約2週間後と発表された。

コーディング性能: 50%改善と公開ベンチでのSOTA主張

Z.aiは、社内ベンチマーク「Z.ai Code Bench」でGLM-5.2比50%の改善を達成し、公開ベンチマークのTerminal Bench 3.0とAgents’ Last Examではオープンウェイトモデルとして最高スコアを記録したと発表している。表で比較されているモデルはGLM-5.3、GLM-5.2、Kimi K3、DeepSeek-V4 Pro-0813、Qwen3.8-Max、Opus 4.8、Fable 5(w/ fallback)、GPT-5.6 Solの8モデルだ。以下は主な結果(すべてZ.ai公称値・独自測定)。

  • Terminal Bench 3.0: 28.3(GLM-5.2は4.6。比較対象中ではFable 5が33.7、GPT-5.6 Solが34.6)
  • DeepSWE (v1.1): 66.9(GLM-5.2は46.2。GPT-5.6 Solは72.7)
  • Agents’ Last Exam (ALE-CLI): 28.5(GLM-5.2は23.8。GPT-5.6 Solは28.6)
  • Terminal Bench 2.1: 88.2、NL2Repo: 58、FrontierSWE: 78.1、SWE-Marathon (v1.1): 42.5、PostTrainBench: 39.8
  • 出力トークン効率: Max effortでGLM-5.3は1タスクあたり約75Kトークンで34.5%に対し、GLM-5.2は96Kトークンで23.4%。High effortでは約50Kトークンで31.4%と、Claude Opus 4.8(120Kトークンで29.5%)を上回ったと報告
  • 同社は比較の際、Claude Code 2.1.207ハーネス(max effort・温度1.0など)を使用し、評価方法を脚注で公開している

Z.aiはGLM-5.2から継承したRL戦略(SAOとコンパクション)に加え、実在のエンジニア作業に近い環境をパイプラインで合成して検証する仕組みを構築したと説明。合成された環境の生成・検証・報酬設計を自動化する「slime」フレームワーク(オープンソース、Megatron+SGLang構成)を公開しており、数学・コード・サンドボックス・検証器・長期エージェント環境をデータ生成として差し込める設計だという。

「創発した」サイバー能力と開示プロセス

今回の発表で注目されるのが、事後学習に脆弱性発見データと環境を混ぜた結果、能力が想定より速く発達したという報告だ。Z.aiによれば、GLM-5.3は孤立した欠陥の特定だけでなく、悪用チェーン(exploitation chain)の複数段階をまたいで推論し、完全な悪用計画を形成するようになったという。公表されたサイバー系ベンチマークは以下の通り(すべてZ.ai公称値)。

  • CyberGym(ホワイトボックスなソースコードから脆弱性の特定・検証を行う): 84.5%(GLM-5.2は77.2%)。比較対象8モデル中最良で、GPT-5.6 Sol(83.6%)を上回った
  • ExploitBench(実在の脆弱性とその悪用についての深い推論): 54.4%(GLM-5.2は24.4%で2倍超。GPT-5.6 Solは76.5%)
  • ExploitGym(時間正規化予算内で完了できる悪用タスク数・2時間/6時間): 105/130タスク(GLM-5.2は29/39)
  • 発見された脆弱性の影響は45年にわたり、最古の欠陥は1981年に導入されたもので、平均26.6年間コードベースに存在したと報告

こうした知見は開示プロセスへつながっている。Z.aiは「Z.ai Security Disclosure Ledger」(https://cvd.z.ai/)を公開し、影響を受けるプロジェクト、深刻度、CVE、コードベース内での存在期間を追跡。中国の複数のセキュリティチームと連携してモデルを実際の脆弱性に対して評価してきたと説明している。重みの公開を約2週間延期する理由についても、安全性評価とハードニングの完了を挙げている。

提供形態: API・GLM Coding Plan・ZCode

GLM-5.3はモデルID glm-5.3 としてAPIで利用できる。思考(thinking)は3段階(low/high/max)に対応し、無効化はサポートされない。これまで thinking.type: "disabled" を使っていたアプリケーションは、enabled に変更して reasoning_effort を low に設定しないとリクエストが失敗するため、移行が必要だ。

  • GLM Coding Plan加入者には全員にGLM-5.3が展開済み。新プランはポイント制で、ピーク時間(月〜金の14:00〜18:00 UTC+8)以外は標準の50%のポイントで利用できる
  • ZCodeでは98%超のキャッシュヒット率(〜30%の実効トークン増)、8月31日までの1.5倍クォータブースト(キャッシュ分と合わせ最大180%)、Goal modeによる長期タスクの自動完了、WeChat/Feishuからのリモート操作を提供
  • ZCode・Claude Code・OpenCodeなど、既存のコーディングエージェントから利用可能
  • 重みは「公開から約2週間後」(公式ブログ)に公開予定。ローカル実行はそれ以降となる

なお、本記事の数値はすべてZ.aiの公式発表・独自測定による公称値であり、独立した再現評価は今後を待つ必要がある。オープンウェイトモデルとしての実測評価は、重み公開後にコミュニティの追試が進むとみられる。

出典