TAG / TOPIC

コスト最適化

「コスト最適化」に関するAIニュースと解説記事の一覧です。

03 STORIES

LATEST STORIES

コスト最適化の新着記事

タグ一覧

COMPUTE / 06

KTのAIモデルルーターが公開ベンチマークRouter Arenaで2位に — 精度とコストを両立するTDL方式をオープンソース公開

韓国KTのAutoModelRouter(KT-ModelRouter)がRouter ArenaのAcc-Cost Arenaで2位になった発表を一次情報(RouterArenaリーダーボード、KTのGitHubリポジトリ)に基づき整理。TDL分類・Pareto frontierによるルーティング方式、1,976件の較正クエリと8,400件のテストクエリでの評価、再現性の範囲を扱う。

BUSINESS / 05

DeepSeek、API料金をピーク/オフピーク制に改定 — ピーク時は最大約12倍、オフピークは半額(8月16日施行)

DeepSeekが2026年8月16日16:00(UTC)に施行したV4系APIのピーク/オフピーク料金改定を、公式チェンジログと公式料金表に基づいて整理する。ピーク時間帯は01:00〜04:00・06:00〜10:00 UTCで、オフピークはピークの半額。改定前の公式料金表(Wayback Machine保存版)と比較すると、ピーク時で入力(キャッシュヒット)がV4-Flash約5倍・V4-Pro約12倍、出力は両モデルとも約4.6〜4.7倍になる。コンテキストキャッシュの利用価値の変化や、時間帯によるコスト最適化の視点もあわせて解説する。

COMPUTE / 06

同一クラスタでGPU利用率+33ポイント — Dharma-AIが「割当順序」を変えるだけで改善した制約認識型アロケータを公開

Dharma-AIが2026年8月17日にHugging Faceブログで公開したGPU管理の第2弾「Same Cluster, 33 Points More Utilization: What Changed Was the Order」を整理する。制約認識型GPUアロケータをFIFOスケジューラと比較し、同一ハードウェア・同一ワークロードでGPU利用率が最大33ポイント、優先度重み付き出力が最大105%(平均52%)向上したと報告する。リアルタイム推論の最大需要分を終日確保する「予約」と、優先度を無視した「到着順配置」というFIFOの2つのコストを特定し、制約を明示した最適化と需要予測を組み合わせた設計を紹介する。数値はすべてDharma-AIの自社シミュレーションによる公称値であり、独立した再現評価は未公表。