DeepSeek-V4-Flash-0731 は DeepSeek-V4-Flash の公式リリースで、プレビュー版を置き換える。モデル構造は DeepSeek-V4-Flash-DSpark と同じく投機デコードモジュール付きで、重みは Hugging Face 上で約 304B パラメータ・MIT ライセンスとして配布される。API のモデル ID は deepseek-v4-flash のまま、MODEL VERSION が DeepSeek-V4-Flash-0731 になる。コンテキスト長は 100 万トークン、最大出力は 384K。reasoning_effortlow / high / max の三段階。チャットテンプレートは Jinja ではなくリポジトリの encoding スクリプトで OpenAI 互換メッセージを符号化する。

ベンダー公表のエージェント系ベンチでは、Terminal Bench 2.1 で 82.7、Toolathlon-Verified で 70.3 など、プレビューや V4-Pro(Preview)を上回る数値を挙げている。vLLM では --speculative-configmethod: dspark、SGLang では --speculative-algorithm DSPARK で DSpark を有効化する。

#性能

モデルIntelligence Index出力速度 (tok/s)
GPT-5.6 Luna (max)51178
DeepSeek V4 Flash 0731 (max)50
Gemini 3.6 Flash (high)50212
DeepSeek V4 Flash(プレビュー相当)29*117

Artificial Analysis Intelligence Index では Luna に 1 ポイント差で Gemini 3.6 Flash と同点。0731 の出力速度は未計測で、プレビュー相当行は指数が低く速度のみ比較の目安になる。

#API 価格の比較

モデル入力 ($/1M)出力 ($/1M)
deepseek-v4-flash(キャッシュミス)0.140.28
deepseek-v4-pro(キャッシュミス)0.4350.87
Gemini 3.6 Flash1.507.50

Flash のキャッシュヒット入力は百万トークンあたり 0.0028 ドル。ピーク時間帯の 2 倍料金は予告済みだが、発効日は未定。

#参考文献