青い光を帯びた多層ニューラルネットワークの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / Google

Google DeepMind、次世代フロンティアモデル「Gemini 4 Argon」を発表 — 防御側への段階公開、出力上限100万トークン

9月30日発表の新フロンティアモデル。DeepSWE v1.1で77.9%の最高値、CWE-bench v1で68%の同率首位、出力トークン上限は従来の6.4万から100万へ拡大。まずはFairwind Programの信頼できるサイバー防御者に限定提供し、その後有料APIとAI Ultra加入者へ展開する。

Google DeepMindは2026年9月30日、新たなフロンティアモデル「Gemini 4 Argon」を発表した。発表者は同社SVP兼GoogleチーフAIアーキテクトのKoray Kavukcuoglu氏。長時間にわたる複雑な実務ワークフローを一気に処理できる深い推論を特徴とし、実務のソフトウェア工学、法務・金融などのエンタープライズ知識業務、サイバー防御の3領域で最高水準の性能をうたっている。以下は公式ブログの発表内容の整理であり、評価数値はすべてGoogle自身の公開値である。

長時間ワークフロー向けの設計 — 出力上限100万トークンと価格

  • 出力上限の大幅拡大: 複雑な用途を支えるため、モデルの出力トークン上限を従来の6.4万トークンから業界最大級の100万トークンに拡大した。1回の軌跡で数十万トークンを生成できる余地が、難問を一気に解く推論の深さを支えるとしている。
  • 価格: 導入価格は100万トークンあたり入力2ドル・出力10ドルで、キャッシュ入力は入力価格から95%割引となる。導入期間の終了後は入力4ドル・出力20ドルが適用される。
  • 段階的な提供: これだけの能力を持つモデルの安全な公開には段階的アプローチが必要として、まずFairwind Programを通じた信頼できるサイバー防御者の集団に展開する。米政府の公開前モデルアクセスの自主プロセスにも積極的に参加し、初期テスターのフィードバックを集めながらガードレールを改良したうえで、開発者・企業・消費者向けに提供するという。一般提供は有料API顧客とGoogle AI Ultra加入者から始める予定だ。

評価結果 — コーディング・専門業務・動画理解で最高値を主張

  • DeepSWE v1.1: 実務的な長期ソフトウェア工学タスクの性能を測る評価で77.9%を記録し、新たな最高値としている。
  • 業務ベンチマーク: 金融・コーディング・法務・税務の各分野を米国GDPへの寄与で重み付けした経済影響指標「Vals Index」で首位。多段階の金融リサーチ(Vals Finance Agent v2)や法律リサーチ・起草(Harvey’s Legal Agent Benchmark)など分野別評価でも同様に首位級としている。ZapierのAutomationBench(主要業務機能の end-to-end 実行を測る評価)では51.3%で1位だった。
  • 動画理解: 長尺動画の理解を測るLVBenchでは91.7%で最高値としており、業務用チャートの分析、長尺動画からの詳細特定、一連の文書に基づく行動など、視覚理解を要する知識業務の強さを強調している。

Gemini 4 Argonのベンチマーク評価結果(Google DeepMind公開資料より)

出典: Gemini 4 Argon: our next era of frontier intelligence(画像クレジット: © Google DeepMind)

防御サイバーと安全策 — 信頼できる防御者にはガードレールなしで提供

  • 防御特化の訓練: 新たなサイバー攻撃の時代に防御者を装備させるため、Argonはサイバー防御に高い能力を持つよう訓練された。重大なソフトウェア脆弱性を自律的に発見・検証・修正できるとしている。
  • 信頼できる防御者への提供形態: 信頼できる防御者とGoogle内部チーム向けには、サイバー関連のガードレールなしでArgonを提供し、フロンティア級の防御能力を全面的に活用できるようにする。Wizは重要公共インフラを無償で守る「Scan for Good」構想を通じて既に利用しており、世界の病院で使われる医療ソフトウェアの機微な個人情報を露出し得る重大脆弱性を発見したという。従来のフロンティアモデルが見逃していた深刻なリスクだったとしている。
  • 脆弱性修正の測定: セキュリティ脆弱性の修正能力を測るCWE-bench v1では68%で同率首位となり、3.8 Flash CyberのCWE-bench v0での性能をさらに伸ばした。Google内部の包括的脆弱性ベンチマーク(20言語の複雑なコードベース)や、Wiz内部のブラックボックス侵入テストベンチマーク(ソースなしで稼働中のWebシステムを分析)でも3.8 Flash Cyberからの大きな前進を示したとしている。
  • 4本柱の安全策: 広範な提供に先立ち、(1)サイバー・CBRN攻撃への悪用防止(正当なデュアルユース研究を保ちつつ有害要求を拒否、内部活性の監視による検出強化)、(2)プロンプトインジェクション耐性(Gray Swanの間接プロンプトインジェクション評価で首位)、(3)アライメント監視(思考連鎖と行動を監視し必要時に停止する軽減策、訓練への逆流を避ける注意深い運用)、(4)サンドボックスの堅牢化(高リスク訓練・評価前の隔離・封印)を進めている。推論の透明性維持を業界にも呼びかけている。

社内活用 — 量子・メモリ・大規模言語移行での実績

  • 量子アルゴリズム最適化: 量子コンピューティング研究で、重要応用のボトルネックとなるサブルーチンの時空間リソース(量子ビット×ゲート)の最適化に活用し、ある事例では公開ベースラインを40%上回る結果を数分で得たという。
  • メモリ効率化: Argonエージェント群がデータセンター群のプロファイリングデータを自律分析し、メモリ最適化を特定・適用。展開後は300TiB超のメモリを解放し、総計500TiB〜1PiBの削減見込みとしている。
  • 大規模コード移行: re2やlibgav1などの中核ライブラリからFuchsia OSのZirconカーネル(80万行超)まで、C/C++からRustへの移行にArgonエージェントが従事している。libgav1では既存Rust移植版のSIMDコード3.2万行を置換し、同一の動画出力を保ちつつ2.7倍高速なメモリセーフなデコーダを得たという。いずれも本番展開前に厳格な自動・手動監査とエミュレーションテストを経るとしている。

読み方の注意

  • 上記はすべてGoogle DeepMind側の発表内容の整理であり、評価数値は同社の自己申告である。独立した第三者による再現評価は本記事執筆時点で確認できていない。
  • 一般提供の時期は明示されておらず、「できるだけ早く」開発者・企業・消費者に届けるとの表現にとどまる。価格も導入期間終了後の改定が予告されている。
  • 信頼できる防御者向けの「ガードレールなし」提供は、同社の段階公開方針に基づく限定措置であり、一般向け提供の条件とは異なる。

出典