液冷式AIサーバーと発光する計算基盤の抽象ビジュアル
NAW / COMPUTE 06

IMAGE: AI生成ビジュアル

COMPUTE / INFRASTRUCTURE

OpenAI、GPT-5.6 Sol向け「Ultrafast mode」をプレビュー — Cerebras基盤で最大14倍高速化

Standard処理比で最大14倍、最大750出力トークン/秒を謳う新しいAPIサービスティア。まずは限定顧客向けのプレビューで、CerebrasのWafer-Scale Engineが推論を支える。

OpenAIは2026年8月13日、GPT-5.6 Sol向けの新しいAPIサービスティア「Ultrafast mode」のプレビューを発表した。Standard処理と比べて最大14倍の速度で実行でき、最大750出力トークン/秒を生成する。推論基盤はCerebrasが提供し、OpenAI APIで最初に展開される。まずは選定された顧客向けの限定プレビューとして始まり、キャパシティの拡大に応じてアクセスを広げる計画だ。

速度と知能を両立する設計

Ultrafast modeの特徴は、より小さなモデルや専用モデルへ切り替えずに、GPT-5.6 Solのフロンティア性能をそのまま維持したまま高速化する点にある。OpenAIは、リアルタイム性が求められる業務領域(インシデント対応、金融調査・セキュリティ、カスタマーサポート、コマース、ライブ研究など)での活用を想定している。

  • Standard処理比で最大14倍高速、最大750出力トークン/秒(OpenAI・Cerebras公称値)
  • 品質(インテリジェンス)はStandardと同一とされ、速度のための品質犠牲はないと説明
  • 従来は「速度」を求める場合、より小さいモデルか特化モデルを選ぶ必要があったと整理
  • OpenAI内部でもインシデント対応と研究用途で先行利用し、観測から次の仮説検証までのループを短縮できたと報告

CerebrasのWafer-Scale Engineが支える推論

高速化の技術的な核は、CerebrasのWafer-Scale Engineアーキテクチャだ。GPUベースの推論では、モデル重みをオンチップメモリと外部ストレージの間で繰り返し転送する際のメモリ帯域幅がボトルネックになるとされる。Cerebrasはウェハーサイズのチップ上に44GBのSRAMを搭載し、重みをオンチップに保持することでデータ移動を削減する設計を採用している。

  • モデル重みをオンチップに保持し、トークン生成をパイプライン処理
  • 比較(Artificial Analysisの出力速度報告に基づく): Claude Opus 4.8のFastモード比で約5倍、Claude Fable 5比で約11倍とされる
  • 将来のフロンティアモデルにもスケールする設計とCerebrasは説明

公表された評価結果と提供条件

Cerebrasが実施した評価として、Humanity’s Last Exam(HLE、2,500問)をUltrafastで11時間11分で完了し、Claude Fable 5の78時間27分と比べて約7倍速く同等の精度に達したと報告している。また、経済的価値の高いナレッジワークを測るGDP-Valでは、品質の劣化なしに5.6倍のエンドツーエンド高速化を確認したとしている。これらの数値はCerebrasによる内部評価であり、独立した再現評価は今後を待つ必要がある。

  • 提供開始: OpenAI APIで限定プレビュー(選定された顧客向け)
  • アクセス拡大: キャパシティの拡大に応じて段階的に実施
  • 価格: プレビュー時点では公表されていない
  • 早期利用者としてJane Streetのコメントが公開されている

出典: OpenAI公式ブログ「Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed」、Cerebras公式ブログ「Accelerating GPT-5.6 Sol Ultrafast with OpenAI」、Cerebrasプレスリリース「Cerebras Powers Ultrafast Mode for OpenAI’s GPT-5.6 Sol」(いずれも2026-08-14確認)。