NAW / COMPUTE 06
IMAGE: AI生成ビジュアル
COMPUTE / INFRASTRUCTURE
Cerebras、新型AIアクセラレータ「CS-4」発表 — GPU比最大30倍の推論、CS-3比2倍の速度
Cerebras Systemsは2026年8月18日、第4世代Wafer Scale Engine搭載のラックスケール推論システム「CS-4」を発表した。最大30倍のGPU比推論高速化、ワットあたり10倍のスループット、CS-3比2倍の速度をうたう。3基の新型WSE-3 Turboと低レイテンシのウェハー間リンク、モジュール型Nexusプラットフォームでハイパースケール展開に対応する。
Cerebras Systemsは2026年8月18日(米太平洋時間)、**第4世代システム「Cerebras CS-4」**を発表した。3基の新型Wafer Scale Engine 3 Turbo(WSE-3 Turbo)を中核とするラックスケール構成で、GPU比で最大30倍の推論速度、ワットあたり10倍のスループット、そして現行のCS-3比で2倍の速度をうたう。ハイパースケール環境での大量推論の効率化と段階的な拡張を狙う。
出典: Cerebras — Introducing Cerebras CS-4: The Fastest AI Gets Faster のOG画像より
CS-4の概要 — 3基のWSE-3 Turboとラックスケール設計
- 発表はCerebras公式ブログと投資家向けプレスリリース(GlobeNewswire経由)で同時に行われた。公式ページの説明は**「業界最速のAIアクセラレータ」**と位置づけている
- アーキテクチャの中核は3基の新型WSE-3 Turboプロセッサ。従来のWSE-3を強化したTurbo版をラック単位で統合する
- 低レイテンシのウェハー間リンクで3基のWSEを接続し、ラック内での大規模モデル推論を単一論理システムとして実行する
- プラットフォームは**モジュール型の「Nexus」**を採用。ラックの段階的な増設やハイパースケール容量への拡張を簡素化する設計とされる
- 同社はCS-4を**「フロンティアAIのための新たな基盤」**と表現し、推論ワークロードでの大規模同時実行と低遅延を両立する狙いを示した
公称性能 — GPU比30倍、CS-3比2倍、電力効率10倍
- 公式発表の公称値は以下の通り(すべてベンダー公称値であり、独立した第三者検証ではない):
- GPUベースの推論と比較して最大30倍高速
- ワットあたりスループットで最大10倍
- CS-3との比較で2倍の速度
- 同社の製品ページも**「GPU比で最大30倍高速な推論、強化された経済性、ハイパースケール導入への簡素なパス」**と記載している
- 30倍という数値はシステム構成・モデルサイズ・バッチ条件・精度(量子化)などに依存する。Cerebrasの投資家向けリリースは**「ラックスケール・ソリューション」としての比較**である点を示唆しており、単一GPUカードとの単純比較ではない点に留意が必要だ
- 電力効率の主張についても、データセンター全体の総消費電力・冷却・ネットワークを含めたTCOでの比較か、チップ単体での比較かは一次情報からは明確でない
背景 — 推論需要の拡大と専用アーキテクチャの競争
- 推論需要の急増を背景に、汎用GPUに代わる専用推論アーキテクチャの競争が激化している。Cerebrasはウェハースケールという大型ダイでメモリ帯域と演算密度を高めるアプローチを取る
- 競合では、EtchedのSohu(トランスフォーマー特化ASIC、2026年8月18日に初号ラック出荷)、Groq、SambaNova、またNVIDIAの次世代GPUなどが推論高速化をうたう
- CerebrasはこれまでCS-3でクラウド事業者や研究機関への導入を進めてきた。CS-4はその後継として、大規模言語モデル(LLM)の長時間推論や同時多ユーザーの低レイテンシ応答を主なターゲットとする
- CEOのAndrew Feldman氏は、一次情報上の発言としてCS-4を**「業界で最も高速なシステム」**と説明している(同社の声明による)
留意点 — 公称値と実運用のギャップ
- 今回示された性能はCerebras自身による公称値であり、独立したベンチマーク(MLPerf Inferenceなど)での再現結果は発表時点では一次情報に含まれていない
- ラックスケールでの比較のため、**導入時のラック占有面積・電力・冷却要件・ソフトウェアスタック(コンパイラ、モデル対応)**が総保有コストに影響する
- 実際のワークロードでは、モデル構造(MoE、ロングコンテキスト)、バッチサイズ、量子化手法によって加速率が変動する。ユーザーは自社モデルでのPoC評価が必要になる
出典: