SECTION / COMPUTE

計算基盤・半導体

GPU、AIチップ、クラウド、推論基盤、データセンター、電力まで、AIを動かす物理層を可視化します。

51 ARTICLES

LATEST / INFRASTRUCTURE

Ai2、GPUクラスタのスケジューラ刷新を公開 — 時間予算と階層フェアシェアで割当充足98%

アレン人工知能研究所(Ai2)は2026年10月9日(UTC)、GPUクラスタのスケジューリング刷新をHugging Faceブログで公開した。優先度方式からGPU時間予算・階層フェアシェア・タイムスライシング契約へ移行し、30日間の試行で割当時間の98%を提供し、デバッグジョブのp90待ち時間を2時間から30秒に短縮したとしている。いずれも同研究所の報告値である。

記事を読む

COMPUTE

計算基盤の新着記事

RSSで購読

COMPUTE / 06

SGLang v0.5.21公開 — PDのprefill/decode動的切替とRust製radix tree既定化、Decisions API新設

高性能LLMサービングフレームワークSGLangが2026年10月2日に安定版v0.5.21を公開。PDインスタンスのprefill/decode動的切替、Rust製radix treeの既定化、Decisions API(/v1/decisions)の新設、DeepSeek-V4.1 Flash・MiMo-V2.6・DiffusionGemmaなど新規7モデル対応、セキュリティ修正を含む。破壊的変更もあるためUpgrade Notesの確認が必要。

COMPUTE / 06

Googleの「Project Suncatcher」試作衛星が軌道に — TPUの宇宙実証へ、Planet・SpaceXと連携

Googleが2026年10月1日にProject Suncatcherの試作衛星の軌道投入を発表した。Planetと共同開発しSpaceXのライドシェアで打ち上げ、衛星との交信を確立。AI計算基盤を宇宙に置けるかを検証する長期ムーンショットで、TPUの耐振動・耐放射線・冷却の一次情報を整理する。

COMPUTE / 06

Ai2、MoE学習基盤「Olmo-core 3」を公開 — 1兆パラメータ級のオープンな学習スタック

アレンAI研究所(Ai2)が2026年10月1日にMoE学習フレームワーク「Olmo-core 3」を公開した。エキスパート並列・パイプライン並列・分散オプティマイザに加え、GPU常駐ルーティングやMXFP8対応で1兆パラメータ級の学習に対応。次世代Olmoの基盤にもなる完全オープンの学習スタックを一次情報に基づき整理する。

COMPUTE / 06

OpenAIとSynopsysが「GPT-Synopsys」を共同開発へ — EDAツールを操る半導体設計特化モデル

OpenAIとSynopsysが半導体設計特化モデルGPT-Synopsysの共同開発を発表。EDAツールを熟練技術者のように操作しPPA最適化や検証を行う構想で、OpenAIホスト基盤上で動作しSynopsys.aiやAutopilotと統合。収益分配・共同GTMを含む複数年契約の内容を一次情報に基づき整理する。

COMPUTE / 06

NVIDIAが「Open Agent Safety Platform」を発表 — OpenShellとSentryでエージェントにフルスタックの安全境界

NVIDIAが2026年9月28日に発表したOpen Agent Safety Platformを一次情報(公式プレスリリース)に基づき整理。オープンソースのOpenShell実行時境界、BlueField-4上のSentryによるミリ秒単位の隔離、Vera CPUとの組み合わせ、参画企業、AnthropicのManaged Agentsとの連携を扱う。

COMPUTE / 06

KTのAIモデルルーターが公開ベンチマークRouter Arenaで2位に — 精度とコストを両立するTDL方式をオープンソース公開

韓国KTのAutoModelRouter(KT-ModelRouter)がRouter ArenaのAcc-Cost Arenaで2位になった発表を一次情報(RouterArenaリーダーボード、KTのGitHubリポジトリ)に基づき整理。TDL分類・Pareto frontierによるルーティング方式、1,976件の較正クエリと8,400件のテストクエリでの評価、再現性の範囲を扱う。

COMPUTE / 06

Google DeepMind、Private AI Computeにサーバー側メモリ — 鍵は端末保持、クラウドでも端末並みの秘匿性へ

Google DeepMindが2026年9月23日に公開したPrivate AI Computeのサーバー側メモリ技術更新を一次情報に基づき整理。永続メモリ層の仕組み、セキュアエンクレーブ、鍵管理、透明性施策(技術概要・改ざん検知可能な公開記録・独立監査)を扱う。

COMPUTE / 06

Cisco、SplunkのAI新機能群を発表 — エージェント可観測性×Tokenomics、NVIDIA連携のオンプレAI、AWSと共同開発

CiscoはSplunk年次イベント.conf26でSplunk AIの新機能群を発表した。エージェント性能とトークン支出を可視化するAgent Observability+Tokenomics、NVIDIAと組んだオンプレ向けAI基盤、自社モデル持ち込み対応、エージェント型SOC拡張、AWSとの共同開発契約が柱。Ciscoニュースルームのプレスリリースに基づく。

COMPUTE / 06

Huawei、新計算アーキテクチャ「Peerium」を発表──100万プロセッサを1台のコンピュータに

HuaweiがAI時代向け新計算アーキテクチャPeeriumを発表。Nested BSPによるネスト並列、統一メモリアドレス、ピア相互接続で100万プロセッサ規模の動作を可能にし、相互接続技術UnifiedBusを採用。第1世代のAtlas 950 SuperClusterは25.6万カード規模で展開中。

COMPUTE / 06

SGLang v0.5.19公開 — ビームサーチ対応とDeepEP v2、統合radix treeの既定化で786 PR

高性能LLMサービングフレームワークSGLangが2026年9月5日に安定版v0.5.19を公開。786件のPR・214名のコントリビューターによる大規模リリースで、ビームサーチ対応、DeepEP v2 ElasticBufferバックエンド、統合radix treeの既定化、LayerNorm系列並列、Hopper向けW4A8 MoE、Blackwell既定バックエンドでのDCP、AMD向けLean attention、Qwen3.8・Spark2.5・Granite 4.2など9モデルの新規対応を含む。

COMPUTE / 06

llama.cpp v0.4.0公開 — Qwen3.8-Flash-Nextの初期対応と遅延テンソル読み込み、ggml 0.23.0へ更新

ローカルLLM推論エンジンllama.cppが2026年9月4日に安定版v0.4.0を公開。Qwen3.8-Flash-Next(qwen4exp)の初期アーキテクチャ対応、NVIDIA Nemotron-3-Puzzle-75B-A9BとNemotron 3.5のDSpark対応、遅延テンソル読み込み、スロット別コンテキスト上限、動画入力オプション、ggml v0.23.0(スパースflash attention・Apple RDMA)への更新を含む。

COMPUTE / 06

NVIDIA、無料のローカル推論ルーター「PAIR」ベータを公開 — 自宅のRTX・DGX Spark・Macを束ねて単一エンドポイント化

NVIDIAが2026年9月3日にPersonal AI Router(PAIR)ベータを公開。自宅のRTX PC・DGX Spark・MacをプライベートなローカルAIクラスタとして束ね、OllamaやLM Studioの推論要求を単一エンドポイントで振り分ける無料ツール。要件・仕組み・提供形態を一次情報に基づいて整理する。

COMPUTE / 06

NVIDIA、MediaTekに35億ドル出資 — 転換社債でAIエッジからクラウドまで協業を深化

NVIDIAとMediaTekは2026年8月31日、AIインフラ、ローカルAIコンピューティング、車載の3領域で協業を深化すると発表した。MediaTekはNVIDIA NVLink Fusionを採用し、ハイパースケーラー向けのカスタムXPU開発基盤を提供。NVIDIAはMediaTek発行の転換社債35億ドルを引き受ける。GB10 Grace Blackwell Superchipを搭載するDGX Sparkや、将来のAI定義車両まで含めたエッジからクラウドのAIプラットフォーム構築が狙い。

COMPUTE / 06

llama.cpp v0.3.0公開 — Dots3-Note対応とDeepSeek 4テンソル分割、ggml 0.22.0へ更新

人気のローカルLLM推論エンジンllama.cppが2026年8月25日にv0.3.0を公開。新アーキテクチャdots3-note(DSA-ISWA KVキャッシュ)と視覚・音声対応、GLM-4.5-AirのMTP、DeepSeek 4のtensor-split(-sm tensor)とマルチシーケンスロールバック修正を含む。ggmlはv0.22.0へ更新しメタバックエンドでのテンソル分割やMetalのper-op並列コンパイルを導入、mtmdはWebPやPillow準拠リサイズ、サーバーとWeb UIも改善された安定版リリース。

COMPUTE / 06

小米、玄戒(Xuanjie)3チップ同時発表 — O3・O100・D100で端末からクラウド・自動運転まで自社シリコン展開

小米(Xiaomi)が2026年8月24日、北京で開催した玄戒チップ技術コミュニケーション会で、玄戒O3(3nm 10コアSoC)、玄戒O100(6nm 3D積層 AI加速チップ)、玄戒D100(3nm 自動運転SoC)の3製品を同時発表した。AI CubeミニPCを含むローカルLLM実行や車載への展開が示され、中国勢のAIシリコン自立の動きとして注目される。

COMPUTE / 06

Cerebras、新型AIアクセラレータ「CS-4」発表 — GPU比最大30倍の推論、CS-3比2倍の速度

Cerebras Systemsは2026年8月18日、新型ラックスケールAIアクセラレータ「Cerebras CS-4」を発表した。3基のWSE-3 Turbo、モジュール型Nexusプラットフォームを採用し、GPU比で最大30倍の推論速度、ワットあたり10倍のスループット、従来CS-3比で2倍の速度を公称する。発表はCerebras公式ブログおよび投資家向けリリース(GlobeNewswire)に基づく。

COMPUTE / 06

SGLang v0.5.18公開 — 710 PRで起動2.38倍高速化、Muse Glimmerなど新規モデル7種に対応

高性能LLMサービングフレームワークSGLangが2026年8月22日にv0.5.18を公開。710 PR・212 contributorsの大規模リリースで、Muse GlimmerやIntern-S2-Mobius、SANA-Videoなど7モデルを新規対応。Qwen3-32Bの起動を2.38倍高速化するオーバーラップ読み込み、DeepSeek-V4系のLMHead/AllReduce最適化、統合キャッシュディレクトリなど基盤改善を一次情報に基づき整理。

COMPUTE / 06

KT、「KT NPU LLM Station」を発表 — 国産NPU(Rebellions ATOM-MAX)と自社LLMを統合した企業向けソブリンAIアプライアンス

韓国KTは2026年8月19日、国産AI半導体と自社LLMを単一サーバに統合した企業向けソブリンAIアプライアンス「KT NPU LLM Station」を発表した。韓国のAIチップ企業Rebellionsの推論特化NPU「ATOM-MAX」と、KT自社開発のLLM「Mi:deum K 2.5 Pro」、運用APIプラットフォームを一体化。オンプレミス稼働でデータとAI処理を社内に閉じ、公共・国防・製薬・製造・金融など規制の厳しい業界での外部生成AI導入の制約に対応する。推論特化NPUの採用で同等GPUサーバ比の電力効率向上を謳い、既存AIサービスのAPI接続先変更だけで利用可能とされる。将来は議事録・コーディング支援・「K-Claw」など自社AIエージェントの追加や、物理AI向けエッジデータセンターへの展開を計画する。内容はKTの発表(韓国・英語メディアが伝えるところ)に基づく。

COMPUTE / 06

Etched、評価額21億ドルで7億ドル調達 — Jane Street主導、1カ月で約2倍。専用推論チップの初号ラックを納入

Etchedは2026年8月18日、Jane Street主導の7億ドル調達と評価額21億ドルへの到達、およびトランスフォーマー専用推論チップ「Sohu」搭載ラックの初号出荷(顧客はJane Street)を発表した。7月下旬のラウンド時点で約10.3億ドルと報じられていた評価額は、1カ月足らずで約2倍に拡大した。Jane Streetは調達の主導投資家であると同時に初号顧客で、ラックは同社データセンターで本番ワークロードの推論を実行中とされる。数値・内容はEtched公式サイトおよび同社発表に基づく公称値として整理する。

COMPUTE / 06

中国・清昴智能、AIが自らを最適化する「自進化AI Infra」を展開 — 国産チップ向けの開発・適応を約30〜336倍高速化と公表

清昴智能は2026年8月18日付の量子位(QbitAI)の取材記事で、AIが自らを最適化する「自進化AI Infra」の取り組みを詳報した。複雑なオペレーターの開発・調整を約2週間→約1時間(約336倍)、モデルの国産チップ向け全スタック適応を約30倍に高速化したとする。技術は清華大学・朱文武教授研究室の「自己駆動機械学習(Self-Driven Machine Learning)」が源流で、主力のMLGuiderはNVIDIAに加え昇騰・寒武紀などの国産チップをサポート。北京市の算力センターなどで実績を積み、トークン生産の「工場」を自社運営するビジネスも始めている。

COMPUTE / 06

Cloudflare Workers AIにQwen 3.8 27Bが登場 — 262KコンテキストのApache 2.0 VLMをエッジ推論で利用可能に

Cloudflareは2026年8月17日、Workers AIにQwen 3.8 27Bを追加した。Alibaba QwenがApache 2.0で公開した27B密度型VLMが、エッジAI推論プラットフォームで利用可能になる。機能・料金・利用方法を一次情報(Cloudflare公式Changelog・モデルページ)に基づいて整理する。

COMPUTE / 06

同一クラスタでGPU利用率+33ポイント — Dharma-AIが「割当順序」を変えるだけで改善した制約認識型アロケータを公開

Dharma-AIが2026年8月17日にHugging Faceブログで公開したGPU管理の第2弾「Same Cluster, 33 Points More Utilization: What Changed Was the Order」を整理する。制約認識型GPUアロケータをFIFOスケジューラと比較し、同一ハードウェア・同一ワークロードでGPU利用率が最大33ポイント、優先度重み付き出力が最大105%(平均52%)向上したと報告する。リアルタイム推論の最大需要分を終日確保する「予約」と、優先度を無視した「到着順配置」というFIFOの2つのコストを特定し、制約を明示した最適化と需要予測を組み合わせた設計を紹介する。数値はすべてDharma-AIの自社シミュレーションによる公称値であり、独立した再現評価は未公表。

COMPUTE / 06

Groq、3.5億ドルを調達 — 評価額35億ドル、NVIDIA参加予定。AIチップ専業から「ネオクラウド」へ戦略転換を加速

Groqは2026年8月17日、3.5億ドルの資金調達を発表した。リード投資家はDisruptiveで、NVIDIAの参加が予定されている。評価額は35億ドル。6月の6.5億ドル調達と合わせ直近の調達額は10億ドルに達し、13か所のデータセンターでNVIDIA基盤の推論クラウド事業を展開する。LPU(Language Processing Unit)の開発・運用で知られた同社は、NVIDIA Cloud Partnerとしてアクセラレーテッドコンピューティングの設計・運用認証を受け、2027年に54MWから200MW超への拡張を計画している。調達は慣例的なクロージング条件に従うとされる。

COMPUTE / 06

OpenAI、オハイオ州「PORTS-Pike」プロジェクトに正式参加 — 約8 GW-ITのAIデータセンターをSB Energy・NVIDIA・DOEと共同開発

OpenAIが2026年8月17日、オハイオ州パイク郡のPORTS-Pike Technology Campusで約8 GW-ITのAIデータセンター容量を確保する合意を公式発表した。SB Energyが建設・所有・運用しOpenAIへ20年リース、NVIDIAが独占AIコンピュート提供者として初期4.25 GW-ITに信用支援(残り3.75 GW-ITはオプション)を供与。SB Energy/ソフトバンクによる最低10GWの新規発電とAEP Ohioとの最低42億ドルの送電網投資、当初8,000万ドルのコミュニティ基金とOpenAIの追加4,000万ドル拠出など、8月14〜16日に報じられた巨額保証報道の対象とみられた計画が正式な形で発表された内容を一次情報に基づき整理する。

COMPUTE / 06

NVIDIA、OpenAI向けオハイオ州10GWデータセンターで約1,000億ドルの信用保証に合意間近 — 当初の2,500億ドルから縮小(The Information・WSJ報道)

The Informationは2026年8月15〜16日、NVIDIAがOpenAIのオハイオ州データセンター計画に対し約1,000億ドルの信用保証を提供する合意に近づいていると報じた。WSJは8月14日、当初約2,500億ドルとされた保証規模を1,200億ドル未満に縮小する形で取引を再構成したと報道。SB Energy(ソフトバンク傘下)開発の10GW級キャンパスを対象に、NVIDIAは最大30億ドルの出資も協議中とされる。報道記事(The Information・WSJ)と公開済みの一次情報(OpenAI公式発表)に基づき、保証額の変遷とプロジェクト概要を整理する。

COMPUTE / 06

Cloudflare Workers AIにDeepSeek V4 Flash/Proが登場 — プラットフォーム初の100万トークンコンテキスト

Cloudflareは2026年8月14日、Workers AIにDeepSeek V4 FlashとDeepSeek V4 Proを追加した。プラットフォーム初の100万トークンコンテキスト対応モデルで、思考モードと関数呼び出しにも対応する。モデルの特徴、利用方法、提供条件を一次情報(Cloudflare公式Changelog)に基づいて整理する。