API pricing per million tokens
- Input
- $0.053
- per 1M, StreamLake (fp8)
- Output
- $0.158
- per 1M tokens
- Cached input
- $0.0017
- no batch tier listed
- Context
- 1.31M
- 944K max output
Where to buy it (29)
- StreamLakefp8, fp8$0.053 / $0.158cached $0.0017
DeepInfrafp8, fp8$0.06 / $0.18cached $0.015
- Relacefp4, fp4$0.04 / $0.32cached $0.016
- Makoradefault region$0.09 / $0.195cached $0.02
- Waferfast$0.08 / $0.35cached $0.02
DigitalOceandefault region$0.119 / $0.238cached $0.024
Basetenfp8, fp8$0.13 / $0.26cached $0.028
- Sail Researchfp4, fp4$0.038 / $0.55cached $0.023
CoreWeavefp8, fp8$0.13 / $0.28cached $0.07
Coheredefault region$0.14 / $0.28cached $0.07
Nebiusfp8, fp8$0.14 / $0.28$0.175 blended
Parasailfp8, fp8$0.14 / $0.28cached $0.05
Together AIdefault region$0.14 / $0.28cached $0.03
- Rekafp4, fp4$0.088 / $0.528cached $0.0056
- Morphdefault region$0.142 / $0.4cached $0.036
Venicedefault region$0.175 / $0.35cached $0.035
- Inceptronfp4, fp4$0.091 / $0.613cached $0.06
- OpenInferencefp8, fp8$0.14 / $0.7cached $0.03
- Mancer 2fp8, fp8$0.2 / $0.6$0.3 blended
Fireworks AIdefault region$0.22 / $0.66cached $0.007
SiliconFlowfp8, fp8$0.22 / $0.66cached $0.028
- GMICloudfp8, fp8$0.286 / $0.858cached $0.0091
- NextBitfp8, fp8$0.352 / $1.06cached $0.012
Qwen (Alibaba)default region$0.352 / $1.06cached $0.035
Novita AIfp8, fp8$0.409 / $1.23cached $0.026
- AtlasCloudfp4, fp4$0.44 / $1.32cached $0.028
- Baidufp8, fp8$0.44 / $1.32cached $0.014
Cloudflare Workers AIdefault region$0.44 / $1.32cached $0.014
- Phaladefault region$0.44 / $1.32cached $0.028
Through a gateway
Your own numbers100M input and 20M output tokens a month: $8.45 direct.
Helicone$8.45+0%
Kong AI Gateway$8.45+0%
LiteLLM$8.45+0%
Vercel AI Gateway$8.45+0%
AWS Bedrock$8.45+0%
Azure AI Foundry$8.45+0%
Google Vertex AI$8.45+0%
Databricks Mosaic AI$8.45+0%
Hugging Face Inference$8.45+0%
Cloudflare AI Gateway$8.87+5%
Requesty$8.87+5%
Eden AI$8.91+5.5%
OpenRouter$8.91+5.5%
Snowflake Cortex AI$10.14+20%
Martian Gatewayn/a
Portkeyn/a
TrueFoundry AI Gatewayn/a
IBM watsonx.ain/a
OCI Generative AIn/a
BigQuery MLn/a
Cloudflare Workers AIn/a
NVIDIA NIMn/a
Related models
DeepSeek V4.1 FlashDeepSeek ยท 1M$0.15 / $0.6in / out per 1M$0.15$0.6$0.0031MSep 10, 2026
DeepSeek V4 Flash Vision ExpDeepSeek ยท via DeepInfra (fp8) ยท 1M$0.216 / $0.647in / out per 1M$0.216$0.647$0.00691MAug 21, 2026
DeepSeek V4 Pro 0813DeepSeek ยท 1M$0.66 / $1.98in / out per 1M$0.66$1.98$0.0221MAug 12, 2026
DeepSeek V4 Flash 0423DeepSeek ยท via StreamLake (fp8) ยท 1M$0.089 / $0.177in / out per 1M$0.089$0.177$0.0181MApr 24, 2026
Muse Spark 1.3 ContributorMeta ยท 1M$0.1 / $0.2in / out per 1M$0.1$0.2$0.0021MSep 2, 2026
GLM 5.3 FlashZ.ai ยท via InferenceNet (fp4) ยท 1.31M$0.045 / $0.14in / out per 1M$0.045$0.14$0.011.31MAug 26, 2026
Muse Spark 1.2 ContributorMeta ยท 1M$0.1 / $0.2in / out per 1M$0.1$0.2$0.0021MAug 21, 2026
Qwen3.7 FlashQwen (Alibaba) ยท 1M$0.03 / $0.13in / out per 1M$0.03$0.13$0.0061MJul 27, 2026
About DeepSeek V4 Flash 0731
DeepSeek V4 Flash 0731 is a sparse mixture-of-experts model from DeepSeek, with 13B active parameters out of 284B total.
Takes text in and returns text. First listed Sep 23, 2026. Blended price $0.079 per 1M tokens at 3 input to 1 output.
Questions
How much does DeepSeek V4 Flash 0731 cost?
$0.053 per million input tokens and $0.158 per million output tokens, with cached input at $0.0017.
What is the context window of DeepSeek V4 Flash 0731?
1.31M tokens, with up to 944K tokens of output.
Where is DeepSeek V4 Flash 0731 cheapest?
Of 29 routes tracked, StreamLake is cheapest at $0.053 input and $0.158 output per million tokens.
Has DeepSeek V4 Flash 0731's price changed?
Yes. The output price went from $0.528 to $1.06, first seen Sep 24, 2026.
List prices from providers' pages on the date shown; your contract may differ. Logos via logo.dev; trademarks belong to their owners.