IMAGE: AI生成ビジュアル
MODELS / MODEL WATCH
DeepSeek、マルチモーダル「V4-Flash-Vision-Exp」を公開 — V4-Flash同等のテキスト性能に視覚理解を追加、Files APIも同時提供
2026年8月21日にAPIで提供開始。モデル名はdeepseek-v4-flash-vision-exp、画像は最大384トークンで課金。Chat Completions/Messages/Responsesに対応し、base64・URL・Files APIの3経路で画像入力が可能。
DeepSeekは2026年8月21日、実験的マルチモーダルモデルDeepSeek-V4-Flash-Vision-ExpをDeepSeek API Platformで公開した。テキストのエージェント・推論・知識性能はDeepSeek-V4-Flash(V4-Flash-0731)同等を維持しつつ、視覚理解を統合することでマルチモーダルエージェント性能が大幅に向上しOpus-4.8に迫るとしている。APIでは model='deepseek-v4-flash-vision-exp' で呼び出せ、画像入力はbase64/外部URL/Files APIの3経路に対応。あわせて画像の再利用と大容量対応を目的としたFiles APIも正式提供を開始した。
出典: DeepSeek-V4-Flash-Vision-Exp Release: Multimodal API Now Live — DeepSeek API Docs (2026-08-21)
実験的マルチモーダル — テキストは据え置き、視覚でエージェント性能を拡張
V4-Flash-Vision-Expの位置づけは「V4-Flashに視覚を足した実験版」。一次情報が示すポイントは以下の通り。
- テキスト能力はV4-Flashと同等: エージェント、推論、世界知識を含むテキスト性能はV4-Flashと同水準を維持するとしている
- マルチモーダルエージェントで大幅向上: 視覚を要するエージェントベンチマークでV4-Flashから大きく伸び、Opus-4.8に近い水準に達すると提示(いずれもベンダー公称値。独立評価は今後確認が必要)
- エージェントフレームワークと親和: 視覚理解とツール呼び出しを組み合わせ、実務的なワークフローを解くと説明。DeepSeek Harness 0.1.1が同日リリースされ、同モデルのサポートを標準で含む
- モデルバージョン: V4-Flashは
DeepSeek-V4-Flash-0731、V4-ProはDeepSeek-V4-Pro-0813、Vision-ExpはDeepSeek-V4-Flash-Vision-Expと表記
ベンチマーク画像は一次情報に掲載された比較チャートをそのまま掲載した。数値はDeepSeekによる提示であり、測定条件やデータセットの詳細は今後の技術レポート等での開示を待ちたい。
APIの使い方 — 3つの画像入力と料金・トークン規則
Vision対応は既存のOpenAI互換エンドポイントでそのまま利用できる。入力方法と課金・制限は次の通り。
- モデル指定:
model='deepseek-v4-flash-vision-exp'(Chat Completions/Messages/Responsesのいずれでも利用可) - 画像入力の3経路:
image_urlにdata:image/...;base64,...を渡すインライン方式- 公開URL(
https://...)を渡しサーバ側で取得する方式(URLは最大8192文字、画像は最大32MiB、ダウンロード60秒以内) - Files APIで事前アップロードした
file_idを{"type":"file","file_id":"file-api-..."}で参照する方式(推奨)
- 混在入力: テキストと画像の同時送信が可能。複数画像も各画像ごとに独立してトークン換算される
- トークン換算と上限: 画像は解像度(ピクセル数)に応じてトークン化され、テキストトークンと合算で課金。1画像あたり上限384トークン(例: 2000×2000と5000×5000はリサイズ後に同トークン)。概ね384×384未満は拡大して換算
- リクエストサイズ: インライン画像はリクエスト本文の 48MiB上限 に含まれる。Files API経由の
file_id参照は同上限の節約になり、画像単体では 最大64MiB まで可能(インラインの32MiB制限を超えられる) - その他仕様: コンテキスト長1M、最大出力384K、Thinking Mode(非思考/思考)対応、JSON出力・Tool Calls・Responses API・Anthropic APIに対応。FIM CompletionはVision-Expでは非対応
料金はV4-Flashと同額で、ピーク/オフピークの時間帯別料金が適用される。
| 区分 | オフピーク | ピーク |
|---|---|---|
| 入力(キャッシュヒット)/1M | $0.007 | $0.014 |
| 入力(キャッシュミス)/1M | $0.22 | $0.44 |
| 出力 /1M | $0.66 | $1.32 |
画像トークンも上記入力単価でテキストと合算して課金される。並行実行の上限は2500(V4-Proは500)。
Files APIが正式提供 — 再利用と帯域削減が狙い
同時に提供開始したFiles APIは、画像(および汎用ファイル)のアップロードと file_id による再利用を可能にするAPI。一次情報が挙げる利点は以下の通り。
- 無料で利用可能
- 一度アップロードした画像を
file_idで参照 — 同一画像を複数リクエストで使い回す際に毎回base64を送る必要がなく、帯域とレイテンシを削減 - 大容量・再利用に有利 — インラインでは本文48MiBや画像32MiBの上限に抵触する場合でも、Files API経由なら最大64MiBまで扱える
- ドキュメント: API Guides - Files API および API Guides - Vision に使い方とサンプルが掲載
エージェント用途では、同じスクリーンショットや図表を複数ステップで参照するケースが多く、Files APIによる再利用はトークン課金は変わらないものの転送量と実装の簡潔さで利点がある。DeepSeekはHarnessや各種エージェントフレームワークでの利用を想定しているとしている。
出典: