青い光を帯びた多層ニューラルネットワークの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / MODEL WATCH

DeepSeek、マルチモーダル「V4-Flash-Vision-Exp」を公開 — V4-Flash同等のテキスト性能に視覚理解を追加、Files APIも同時提供

2026年8月21日にAPIで提供開始。モデル名はdeepseek-v4-flash-vision-exp、画像は最大384トークンで課金。Chat Completions/Messages/Responsesに対応し、base64・URL・Files APIの3経路で画像入力が可能。

DeepSeekは2026年8月21日、実験的マルチモーダルモデルDeepSeek-V4-Flash-Vision-ExpをDeepSeek API Platformで公開した。テキストのエージェント・推論・知識性能はDeepSeek-V4-Flash(V4-Flash-0731)同等を維持しつつ、視覚理解を統合することでマルチモーダルエージェント性能が大幅に向上しOpus-4.8に迫るとしている。APIでは model='deepseek-v4-flash-vision-exp' で呼び出せ、画像入力はbase64/外部URL/Files APIの3経路に対応。あわせて画像の再利用と大容量対応を目的としたFiles APIも正式提供を開始した。

DeepSeek-V4-Flash-Vision-Exp のベンチマーク — マルチモーダルエージェント性能でOpus-4.8に迫るとする比較(ベンダー公称値) 出典: DeepSeek-V4-Flash-Vision-Exp Release: Multimodal API Now Live — DeepSeek API Docs (2026-08-21)

実験的マルチモーダル — テキストは据え置き、視覚でエージェント性能を拡張

V4-Flash-Vision-Expの位置づけは「V4-Flashに視覚を足した実験版」。一次情報が示すポイントは以下の通り。

  • テキスト能力はV4-Flashと同等: エージェント、推論、世界知識を含むテキスト性能はV4-Flashと同水準を維持するとしている
  • マルチモーダルエージェントで大幅向上: 視覚を要するエージェントベンチマークでV4-Flashから大きく伸び、Opus-4.8に近い水準に達すると提示(いずれもベンダー公称値。独立評価は今後確認が必要)
  • エージェントフレームワークと親和: 視覚理解とツール呼び出しを組み合わせ、実務的なワークフローを解くと説明。DeepSeek Harness 0.1.1が同日リリースされ、同モデルのサポートを標準で含む
  • モデルバージョン: V4-Flashは DeepSeek-V4-Flash-0731、V4-Proは DeepSeek-V4-Pro-0813、Vision-Expは DeepSeek-V4-Flash-Vision-Exp と表記

ベンチマーク画像は一次情報に掲載された比較チャートをそのまま掲載した。数値はDeepSeekによる提示であり、測定条件やデータセットの詳細は今後の技術レポート等での開示を待ちたい。

APIの使い方 — 3つの画像入力と料金・トークン規則

Vision対応は既存のOpenAI互換エンドポイントでそのまま利用できる。入力方法と課金・制限は次の通り。

  • モデル指定: model='deepseek-v4-flash-vision-exp'(Chat Completions/Messages/Responsesのいずれでも利用可)
  • 画像入力の3経路:
    • image_url に data:image/...;base64,... を渡すインライン方式
    • 公開URL(https://...)を渡しサーバ側で取得する方式(URLは最大8192文字、画像は最大32MiB、ダウンロード60秒以内)
    • Files APIで事前アップロードした file_id を {"type":"file","file_id":"file-api-..."} で参照する方式(推奨)
  • 混在入力: テキストと画像の同時送信が可能。複数画像も各画像ごとに独立してトークン換算される
  • トークン換算と上限: 画像は解像度(ピクセル数)に応じてトークン化され、テキストトークンと合算で課金。1画像あたり上限384トークン(例: 2000×2000と5000×5000はリサイズ後に同トークン)。概ね384×384未満は拡大して換算
  • リクエストサイズ: インライン画像はリクエスト本文の 48MiB上限 に含まれる。Files API経由の file_id 参照は同上限の節約になり、画像単体では 最大64MiB まで可能(インラインの32MiB制限を超えられる)
  • その他仕様: コンテキスト長1M、最大出力384K、Thinking Mode(非思考/思考)対応、JSON出力・Tool Calls・Responses API・Anthropic APIに対応。FIM CompletionはVision-Expでは非対応

料金はV4-Flashと同額で、ピーク/オフピークの時間帯別料金が適用される。

区分 オフピーク ピーク
入力(キャッシュヒット)/1M $0.007 $0.014
入力(キャッシュミス)/1M $0.22 $0.44
出力 /1M $0.66 $1.32

画像トークンも上記入力単価でテキストと合算して課金される。並行実行の上限は2500(V4-Proは500)。

Files APIが正式提供 — 再利用と帯域削減が狙い

同時に提供開始したFiles APIは、画像(および汎用ファイル)のアップロードと file_id による再利用を可能にするAPI。一次情報が挙げる利点は以下の通り。

  • 無料で利用可能
  • 一度アップロードした画像を file_id で参照 — 同一画像を複数リクエストで使い回す際に毎回base64を送る必要がなく、帯域とレイテンシを削減
  • 大容量・再利用に有利 — インラインでは本文48MiBや画像32MiBの上限に抵触する場合でも、Files API経由なら最大64MiBまで扱える
  • ドキュメント: API Guides - Files API および API Guides - Vision に使い方とサンプルが掲載

エージェント用途では、同じスクリーンショットや図表を複数ステップで参照するケースが多く、Files APIによる再利用はトークン課金は変わらないものの転送量と実装の簡潔さで利点がある。DeepSeekはHarnessや各種エージェントフレームワークでの利用を想定しているとしている。

出典: