液冷式AIサーバーと発光する計算基盤の抽象ビジュアル
NAW / COMPUTE 06

IMAGE: AI生成ビジュアル

COMPUTE / DeepSeek

DeepSeek、Huawei Ascend向け基盤ライブラリ「DeepGEMM-Ascend」「DeepEP-Ascend」を公開

行列積カーネルのDeepGEMMとMoE用通信ライブラリのDeepEPをAscend NPUに移植。DeepGEMM側はAPI完全互換・MITライセンス、DeepEP側はFP8 dispatchや専門家並列のall-to-allに対応。NVIDIA版と対になる構成。

DeepSeekは2026年9月29日から30日にかけて、GitHubの公式organization(deepseek-ai)でHuawei Ascend NPU向けの基盤ライブラリ2件を公開した。行列積カーネルライブラリ「DeepGEMM-Ascend」と、分散学習・推論向け通信ライブラリ「DeepEP-Ascend」で、いずれも同社がNVIDIAプラットフォーム向けに公開してきた同名ライブラリのAscend移植版という位置づけである。以下は各リポジトリの公開内容の整理であり、性能に関する記述はすべてREADMEの報告値である。

公開された2件 — 作成日時と位置づけ

  • DeepGEMM-Ascend: リポジトリの作成日時は2026年9月29日(UTC)。説明文は「Huawei Ascend NPU向けのクリーンで効率的な行列積カーネルライブラリ」としている。
  • DeepEP-Ascend: リポジトリの作成日時は2026年9月30日(UTC)。説明文は「Huawei Ascend NPU上での機械学習の学習と推論のための高性能通信ライブラリ」としている。
  • 対になる構成: DeepEP-AscendのREADMEは、公開buffer APIがNVIDIA版DeepEPと整合していると明記している。既存のNVIDIA向け資産や開発手順をAscend側に持ち込みやすい設計をうたう。
  • ライセンス表示の違い: DeepGEMM-AscendにはMIT Licenseの表示がある。一方DeepEP-Ascendは公開時点でライセンス表示がなく、利用条件を確認したい場合はリポジトリの更新を待つ必要がある。

DeepGEMM-Ascend — API完全互換の行列積ライブラリ

  • 互換性: DeepGEMMのAscendへの移植で、DeepGEMMと完全にAPI互換としている。同一のパッケージ名で提供し、他プラットフォームのDeepGEMMと同じAPI・開発手順で使えるとしている。
  • 対応演算: BF16・FP8・FP4のGEMM、MQA logits、MegaMoEの演算子に対応するとしている。
  • 実装の工夫: Ascendの行列積加算プリミティブ(MAD)に対する軽量な抽象化で、フラクタルレイアウトやアライメント制約、アドレス計算などの複雑さを隠す設計としている。スパースなデータ読み込みやコルーチンベースのパイプラインなど、Ascend特有の最適化を多用し、ハードウェアの性能限界に迫るとしている。
  • 読み方の注意: 「多様な行列形状でハードウェアのピーク性能を達成できる」としているが、READMEに記載された同社自身の主張であり、独立した検証結果ではない。

DeepEP-Ascend — MoE向け専門家並列の通信ライブラリ

  • 中核機能: MoEのdispatch/combine向けに専門家並列(EP)のall-to-all操作を提供し、FP8 dispatchや遅延epilogueに対応するとしている。
  • 並列形態の拡張: パイプライン並列(PP)、Bucket集合通信によるコンテキスト並列・データ並列(CP/DP)、Engramによるリモートメモリアクセスなどの通信プリミティブも含むが、開発中(work in progress)と明記している。
  • 実装基盤: Ascend CカーネルはHCCL/HCOMM、UBMEM、URMAを用いて通信し、実行時コンパイルには同社のDeepJITを使う構成としている。
  • 測定環境の記載: 性能測定はAscend 950DT NPUとCANN 9.2.0の環境で実施したものと記載している。測定値の解釈はこの環境に限定される。

出典