COMPANIES / TRACKED TOPIC

DeepSeek

DeepSeekのモデル、エージェント基盤、公開戦略に関する記事。

19 STORIES

COMPANIES

DeepSeekの新着記事

企業一覧

COMPUTE / 06

SGLang v0.5.21公開 — PDのprefill/decode動的切替とRust製radix tree既定化、Decisions API新設

高性能LLMサービングフレームワークSGLangが2026年10月2日に安定版v0.5.21を公開。PDインスタンスのprefill/decode動的切替、Rust製radix treeの既定化、Decisions API(/v1/decisions)の新設、DeepSeek-V4.1 Flash・MiMo-V2.6・DiffusionGemmaなど新規7モデル対応、セキュリティ修正を含む。破壊的変更もあるためUpgrade Notesの確認が必要。

GOVERNANCE / 07

Anthropicが2026年9月の脅威レポート公開 — 中国7研究所による大規模蒸留攻撃を詳細化、Alibabaは1.5億超の対話を観測

Anthropicが2026年9月に脅威レポートを公開。2025年12月〜2026年8月の悪用阻止事例をサイバー・影響工作・監視・詐欺・生物・通常兵器・不正蒸留の7分野で報告。不正蒸留ではAlibaba(1.51億超)、Moonshot(2300万超)、DeepSeek(14日で1210万超)、Zhipuの活動を帰属つきで記載。

COMPUTE / 06

llama.cpp v0.3.0公開 — Dots3-Note対応とDeepSeek 4テンソル分割、ggml 0.22.0へ更新

人気のローカルLLM推論エンジンllama.cppが2026年8月25日にv0.3.0を公開。新アーキテクチャdots3-note(DSA-ISWA KVキャッシュ)と視覚・音声対応、GLM-4.5-AirのMTP、DeepSeek 4のtensor-split(-sm tensor)とマルチシーケンスロールバック修正を含む。ggmlはv0.22.0へ更新しメタバックエンドでのテンソル分割やMetalのper-op並列コンパイルを導入、mtmdはWebPやPillow準拠リサイズ、サーバーとWeb UIも改善された安定版リリース。

COMPUTE / 06

SGLang v0.5.18公開 — 710 PRで起動2.38倍高速化、Muse Glimmerなど新規モデル7種に対応

高性能LLMサービングフレームワークSGLangが2026年8月22日にv0.5.18を公開。710 PR・212 contributorsの大規模リリースで、Muse GlimmerやIntern-S2-Mobius、SANA-Videoなど7モデルを新規対応。Qwen3-32Bの起動を2.38倍高速化するオーバーラップ読み込み、DeepSeek-V4系のLMHead/AllReduce最適化、統合キャッシュディレクトリなど基盤改善を一次情報に基づき整理。

MODELS / 01

DeepSeek、マルチモーダル「V4-Flash-Vision-Exp」を公開 — V4-Flash同等のテキスト性能に視覚理解を追加、Files APIも同時提供

DeepSeekが2026年8月21日、実験的マルチモーダルモデルDeepSeek-V4-Flash-Vision-ExpをAPIで公開。V4-Flashと同等のテキスト性能を維持しつつマルチモーダルエージェント性能を大幅強化し、Opus-4.8に迫るとするベンダー公称ベンチマークを提示。料金はV4-Flashと同額、Files APIを同時リリース。

RESEARCH / 04

IBM Research:エージェントメモリは「機能」ではなく「用量」— モデル能力に応じた投与量の較正が精度とコストを左右(ALTK-Evolve)

IBM Researchは2026年8月18日、Hugging Faceブログでエージェントメモリの「適正用量」を検証する研究を公開した。過去の実行軌跡から行動ガイドラインを蒸留し推論時に注入する「ALTK-Evolve」を、30B級の小型モデルからフロンティアのプロプライエタリモデルまで8モデルを対象にAppWorld(585タスク)で評価。強力なモデルは全ガイドラインを注入するのが最適(DeepSeek-V3.2はタスク達成率+9.5pp)、弱いモデルはコンパクトなコア+タスク別検索が最適(gpt-oss-120bは+16.1ppを+5%トークンで達成)、飽和モデルは改善なし(GLM-5)という3パターンを報告。費用面では、選択型検索が精度とコストの両面で最良になり得ることを示した。内容はIBM Researchの一次情報(Hugging Faceブログ)に基づく。

BUSINESS / 05

Vercel AI Gatewayの「2026年8月版Production Index」— Anthropicが支出の65.1%・トークンは30%、平均トークン単価は13.6%下落

Vercelが2026年8月11日に公開した「AI Gateway Production Index」8月版(7月分データ)を一次情報に基づき整理する。毎月数十兆トークンを中継するAI Gatewayの匿名集計データで、トークン量+59%・支出+37%・平均トークン単価-13.6%、DeepSeekのトークン量2位浮上(約25%対Google 11%)、Anthropicが支出65.1%をトークン量30%で獲得(平均単価は他ラボの4.4倍)、Claude Fable 5の7月復帰後の支出13.2%シェア、オープンウェイトの支出シェア倍増(8.6%)などの数値を、測定方法(支出は各社公表リスト価格で評価)とあわせて解説する。

PRODUCTS / 03

DeepSeek Harness、公開5日でGitHubスター15.6万超 —「dsh-plugin」トピック7,000超のプラグインエコシステムが急拡大

DeepSeek Harness(dsh)のプラグインエコシステム急成長を、一次情報(GitHubリポジトリ・GitHub検索API・リリースページ・公式README)に基づいて整理する。2026年8月18日時点でスター15.6万超、dsh-pluginトピック一致リポジトリ7,135件を確認した。

BUSINESS / 05

DeepSeek、API料金をピーク/オフピーク制に改定 — ピーク時は最大約12倍、オフピークは半額(8月16日施行)

DeepSeekが2026年8月16日16:00(UTC)に施行したV4系APIのピーク/オフピーク料金改定を、公式チェンジログと公式料金表に基づいて整理する。ピーク時間帯は01:00〜04:00・06:00〜10:00 UTCで、オフピークはピークの半額。改定前の公式料金表(Wayback Machine保存版)と比較すると、ピーク時で入力(キャッシュヒット)がV4-Flash約5倍・V4-Pro約12倍、出力は両モデルとも約4.6〜4.7倍になる。コンテキストキャッシュの利用価値の変化や、時間帯によるコスト最適化の視点もあわせて解説する。

COMPUTE / 06

Cloudflare Workers AIにDeepSeek V4 Flash/Proが登場 — プラットフォーム初の100万トークンコンテキスト

Cloudflareは2026年8月14日、Workers AIにDeepSeek V4 FlashとDeepSeek V4 Proを追加した。プラットフォーム初の100万トークンコンテキスト対応モデルで、思考モードと関数呼び出しにも対応する。モデルの特徴、利用方法、提供条件を一次情報(Cloudflare公式Changelog)に基づいて整理する。

AGENTS / 02

DeepSeek、エージェント基盤「Harness v0.1」をMITライセンスで公開 — 「すべてがプラグイン」のCordis設計

DeepSeekが2026年8月13日、オープンソースのエージェント実行基盤「DeepSeek Harness(dsh)」v0.1をMITライセンスで公開した。Cordisカーネル上で「すべてがプラグイン」という設計を採用し、追記専用のセッションログによるトレーサビリティを備える。一次情報(GitHubリポジトリ・公式ページ)に基づき整理する。