DeepInfra
- Categories
- Inference hosts
- Owned by
- (private)
- HQ
- US
- Website
- https://deepinfra.com
- Pricing page
- https://deepinfra.com/pricing
- Fee model
- per_token+per_second_gpu
- Fees
- Per-token for LLMs; many non-LLM models billed by inference execution time. Dedicated GPUs billed per minute: A100 80GB $0.89/GPU-h, H100 $2.20/GPU-h, H200 $2.69/GPU-h, B200 $3.69/GPU-h.
- Free tier
- no
- OpenAI-compatible API
- yes
- Notes
- Public model/price JSON at api.deepinfra.com/models/list. Several models offered in Turbo/Ultra speed variants at different prices; also resells some proprietary models (Claude, Gemini).
- Sources
- https://deepinfra.com/pricing https://api.deepinfra.com/models/list collected 2026-09-18
LLM prices (48 models, USD per 1M tokens)
| Model | Input | Output | Cached input | Context | Source |
|---|---|---|---|---|---|
| DeepSeek V3 0324 deepseek-ai/DeepSeek-V3-0324 |
$0.24 | $0.90 | $0.135 | 164k | ✓ src src2 |
| DeepSeek V3.1 deepseek-ai/DeepSeek-V3.1 |
$0.25 | $0.95 | $0.13 | 164k | ✓ src src2 |
| DeepSeek V3.2 deepseek-ai/DeepSeek-V3.2 |
$0.26 | $0.38 | $0.13 | 164k | ✓ src src2 |
| DeepSeek V4 Flash 0423 deepseek-ai/DeepSeek-V4-Flash |
$0.09 | $0.18 | $0.018 | 1.05M | ✓ src src2 |
| DeepSeek V4 Flash 0731 deepseek-ai/DeepSeek-V4-Flash-0731 |
$0.06 | $0.18 | $0.015 | 1.05M | ✓ src src2 |
| DeepSeek V4 Pro 0423 deepseek-ai/DeepSeek-V4-Pro |
$1.30 | $2.60 | $0.10 | 1.05M | ✓ src src2 |
| DeepSeek V4 Pro 0813 deepseek-ai/DeepSeek-V4-Pro-0813 |
$1.30 | $2.60 | — | 1.05M | ✓ src src2 |
| DeepSeek V4.1 Flash deepseek-ai/DeepSeek-V4.1-Flash |
$0.20 | $0.60 | — | 1.05M | ✓ src src2 |
| Gemma 3 27B IT google/gemma-3-27b-it |
$0.08 | $0.16 | — | 131k | ✓ src src2 |
| Gemma 4 26B A4B google/gemma-4-26B-A4B-it |
$0.07 | $0.34 | — | 262k | ✓ src src2 |
| Gemma 4 31B google/gemma-4-31B-it |
$0.13 | $0.38 | — | 262k | ✓ src src2 |
| GLM 4.6 zai-org/GLM-4.6 |
$0.50 | $2 | — | 203k | ✓ src src2 |
| GLM 4.7 zai-org/GLM-4.7 |
$0.40 | $1.75 | — | 203k | ✓ src src2 |
| GLM 5.1 zai-org/GLM-5.1 |
$1.05 | $3.50 | — | 203k | ✓ src src2 |
| GLM-5.2 zai-org/GLM-5.2 |
$0.75 | $2.40 | — | 1.05M | ✓ src src2 |
| GLM-5.3 zai-org/GLM-5.3 |
$1.20 | $4 | — | 1.05M | ✓ src src2 |
| GLM-5.3 Flash zai-org/GLM-5.3-Flash |
$0.15 | $0.50 | — | 1.05M | ✓ src src2 |
| gpt-oss-120b openai/gpt-oss-120b |
$0.037 | $0.17 | — | 131k | ✓ src src2 |
| gpt-oss-20b openai/gpt-oss-20b |
$0.03 | $0.14 | — | 131k | ✓ src src2 |
| Kimi K2.6 moonshotai/Kimi-K2.6 |
$0.75 | $3.50 | $0.15 | 262k | ✓ src src2 |
| Kimi K2.7 Code moonshotai/Kimi-K2.7-Code |
$0.68 | $3.40 | $0.136 | 262k | ✓ src src2 |
| Kimi K3 moonshotai/Kimi-K3 |
$2.85 | $14.25 | $0.285 | 1.05M | ✓ src src2 |
| Llama 3.1 70B Instruct meta-llama/Meta-Llama-3.1-70B-Instruct-Turbo |
$0.40 | $0.40 | — | 131k | ✓ src src2 |
| Llama 3.1 8B Instruct meta-llama/Meta-Llama-3.1-8B-Instruct-Turbo |
$0.02 | $0.04 | — | 131k | ✓ src src2 |
| Llama 3.3 70B Instruct meta-llama/Llama-3.3-70B-Instruct-Turbo |
$0.10 | $0.32 | — | 131k | ✓ src src2 |
| Llama 4 Maverick 17B Instruct meta-llama/Llama-4-Maverick-17B-128E-Instruct-FP8 |
$0.20 | $0.80 | — | 1.05M | ✓ src src2 |
| Llama 4 Scout 17B Instruct meta-llama/Llama-4-Scout-17B-16E-Instruct |
$0.10 | $0.30 | — | 328k | ✓ src src2 |
| MiniMax M2.7 MiniMaxAI/MiniMax-M2.7-Turbo |
$0.38 | $1.70 | — | 197k | ✓ src src2 |
| MiniMax M3 MiniMaxAI/MiniMax-M3 |
$0.28 | $1.10 | — | 524k | ✓ src src2 |
| Mistral Nemo mistralai/Mistral-Nemo-Instruct-2407 |
$0.019 | $0.03 | — | 131k | ✓ src src2 |
| Mistral Small 3.2 24B mistralai/Mistral-Small-3.2-24B-Instruct-2506 |
$0.075 | $0.20 | — | 128k | ✓ src src2 |
| Nemotron 3 Nano 30B nvidia/Nemotron-3-Nano-30B-A3B |
$0.05 | $0.20 | $0.025 | 262k | ✓ src src2 |
| Nemotron 3 Super 120B A12B nvidia/NVIDIA-Nemotron-3-Super-120B-A12B |
$0.085 | $0.40 | — | 262k | ✓ src src2 |
| NVIDIA Nemotron 3 Ultra (Preview) nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B |
$0.50 | $2.20 | $0.10 | 262k | ✓ src src2 |
| Qwen2.5 72B Instruct Qwen/Qwen2.5-72B-Instruct |
$0.36 | $0.40 | — | 33k | ✓ src src2 |
| Qwen3 235B A22B 2507 Qwen/Qwen3-235B-A22B-Instruct-2507 |
$0.09 | $0.55 | — | 262k | ✓ src src2 |
| Qwen3 30B A3B Qwen/Qwen3-30B-A3B |
$0.12 | $0.50 | — | 41k | ✓ src src2 |
| Qwen3 32B Qwen/Qwen3-32B |
$0.08 | $0.28 | — | 41k | ✓ src src2 |
| Qwen3 Coder 480B A35B Qwen/Qwen3-Coder-480B-A35B-Instruct-Turbo |
$0.30 | $1 | $0.10 | 262k | ✓ src src2 |
| Qwen3 Next 80B A3B Qwen/Qwen3-Next-80B-A3B-Instruct |
$0.09 | $1.10 | — | 262k | ✓ src src2 |
| Qwen3.5-122B-A10B Qwen/Qwen3.5-122B-A10B |
$0.29 | $2.40 | — | 262k | ✓ src src2 |
| Qwen3.5-27B Qwen/Qwen3.5-27B |
$0.26 | $2.60 | — | 262k | ✓ src src2 |
| Qwen3.5-35B-A3B Qwen/Qwen3.5-35B-A3B |
$0.14 | $1 | $0.05 | 262k | ✓ src src2 |
| Qwen3.5-397B-A17B Qwen/Qwen3.5-397B-A17B |
$0.45 | $3 | $0.22 | 262k | ✓ src src2 |
| Qwen3.6 27B Qwen/Qwen3.6-27B |
$0.32 | $3.20 | — | 262k | ✓ src src2 |
| Qwen3.6 35B A3B Qwen/Qwen3.6-35B-A3B |
$0.10 | $0.95 | — | 262k | ✓ src src2 |
| Qwen3.8-27B Qwen/Qwen3.8-27B |
$0.20 | $2.50 | — | 262k | ✓ src src2 |
| R1 0528 deepseek-ai/DeepSeek-R1-0528 |
$0.50 | $2.15 | $0.35 | 164k | ✓ src src2 |