Output tokens are the expensive ones

On almost every endpoint in this index, a generated token costs several times more than a supplied one. Across 538 priced endpoints, the median output price is 3.91× the input price — so the fastest way to cut a bill is usually to make the model say less, not to feed it less. Every number here is computed from published prices.

How lopsided is it?

≥ 2× input93% of endpoints
≥ 3× input83% of endpoints
≥ 4× input50% of endpoints
≥ 5× input29% of endpoints

Share of priced endpoints whose output price is at least N× their input price.

Is the premium growing? Every model by release date

One dot per model: release date against its median output/input price ratio across all hosts. Reasoning-heavy models tend to carry the steepest premiums — watch the upper band fill in over time. Click a brand to isolate it.

10×Jul 20242025Jul 20252026Jul 2026output price ÷ input priceQwen 2.5 72B (DeepInfra) — output 1.1× input (median of 2 offers) · released 2024-09-19Qwen3 Next 80B A3B Instruct (Alibaba) — output 10× input (median of 5 offers) · released 2024-12-01Qwen3 30B A3B Instruct 2507 (SiliconFlow) — output 3.3× input (median of 5 offers) · released 2025-04-28Qwen3 14B (DeepInfra) — output 3× input (median of 2 offers) · released 2025-04-28Qwen3 32B (DeepInfra) — output 3.8× input (median of 2 offers) · released 2025-04-30Qwen3 235B A22B Instruct 2507 (GMICloud) — output 4.4× input (median of 9 offers) · released 2025-07-21Qwen3 Coder (DeepInfra) — output 4.3× input (median of 5 offers) · released 2025-07-22Qwen3 235B A22B Thinking 2507 (Alibaba) — output 10× input (median of 3 offers) · released 2025-07-25Qwen3 Coder 30B A3B Instruct (Novita) — output 4× input (median of 4 offers) · released 2025-07-31Qwen3 Next 80B A3B Thinking (Google) — output 8× input (median of 2 offers) · released 2025-09-10Qwen3 VL 235B A22B Instruct (DeepInfra) — output 5× input (median of 5 offers) · released 2025-09-23Qwen3 VL 235B A22B Thinking (Alibaba) — output 7× input (median of 2 offers) · released 2025-09-23Qwen3 VL 30B A3B Instruct (Alibaba) — output 3.8× input (median of 4 offers) · released 2025-10-05Qwen3 VL 30B A3B Thinking (SiliconFlow) — output 7.7× input (median of 2 offers) · released 2025-10-11Qwen3 VL 8B Instruct (Alibaba) — output 3.4× input (median of 2 offers) · released 2025-10-14Qwen3 Coder Next (Parasail) — output 6.7× input (median of 3 offers) · released 2026-02-03Qwen3.5 397B A17B (Alibaba) — output 6.4× input (median of 9 offers) · released 2026-02-15Qwen3.5-35B-A3B (DeepInfra) — output 7.1× input (median of 7 offers) · released 2026-02-23Qwen3.5-27B (Alibaba) — output 8× input (median of 6 offers) · released 2026-02-23Qwen3.5-9B (SiliconFlow) — output 1.5× input (median of 5 offers) · released 2026-02-23Qwen3.5-122B-A10B (SiliconFlow) — output 8× input (median of 5 offers) · released 2026-02-23Qwen3.6 35B A3B (AkashML) — output 6.7× input (median of 9 offers) · released 2026-04-17Qwen3.6 27B (Chutes) — output 8.4× input (median of 7 offers) · released 2026-04-22Qwen3.8 2.4T A95B (Novita) — output 3× input (median of 7 offers) · released 2026-08-12Qwen3.8 27B (Parasail) — output 7.3× input (median of 12 offers) · released 2026-08-14Mixtral 8x22B Instruct (Mistral) — output 3× input (median of 1 offer) · released 2024-04-17Mistral Nemo (DeepInfra) — output 2.6× input (median of 4 offers) · released 2024-07-01Mistral Large 3 (Mistral) — output 3× input (median of 1 offer) · released 2024-11-01Saba (Mistral) — output 3× input (median of 1 offer) · released 2025-02-17Mistral Medium (Mistral) — output 5× input (median of 1 offer) · released 2025-05-07Mistral Medium 3 (Mistral) — output 5× input (median of 1 offer) · released 2025-05-07Mistral Small 3.2 24B (DeepInfra) — output 3× input (median of 2 offers) · released 2025-06-20Codestral 2508 (Mistral) — output 3× input (median of 1 offer) · released 2025-07-30Mistral Medium 3.1 (Mistral) — output 5× input (median of 1 offer) · released 2025-08-13Voxtral Small 24B 2507 (Mistral) — output 3× input (median of 1 offer) · released 2025-10-30Ministral 3 14B 2512 (Mistral) — output 1× input (median of 1 offer) · released 2025-12-02Ministral 3 8B 2512 (Mistral) — output 1× input (median of 1 offer) · released 2025-12-02Ministral 3 3B 2512 (Mistral) — output 1× input (median of 1 offer) · released 2025-12-02Mistral Small (Mistral) — output 4× input (median of 2 offers) · released 2026-03-16Mistral Medium 3.5 (Mistral) — output 5× input (median of 1 offer) · released 2026-04-30DeepSeek Chat (DeepInfra) — output 3.4× input (median of 2 offers) · released 2024-12-26DeepSeek V3 (DeepInfra) — output 2.8× input (median of 1 offer) · released 2024-12-26DeepSeek V3 0324 (DeepInfra) — output 3.8× input (median of 4 offers) · released 2025-03-24DeepSeek R1 (DeepInfra) — output 4.3× input (median of 3 offers) · released 2025-05-28DeepSeek V3.1 (DeepInfra) — output 3.2× input (median of 7 offers) · released 2025-08-21DeepSeek V3.1 Terminus (AtlasCloud) — output 3.7× input (median of 3 offers) · released 2025-09-22DeepSeek V3.2 Exp (SiliconFlow) — output 1.5× input (median of 3 offers) · released 2025-09-29DeepSeek V3.2 (GMICloud) — output 1.5× input (median of 13 offers) · released 2025-12-01DeepSeek V4 Pro 0813 (Alibaba) — output 3× input (median of 18 offers) · released 2026-04-24DeepSeek V4 Flash 0731 (Baidu) — output 2.9× input (median of 22 offers) · released 2026-04-24DeepSeek V4 Flash Vision Exp (DeepInfra) — output 3× input (median of 4 offers) · released 2026-08-21GLM 4.5 Air (Novita) — output 6.1× input (median of 3 offers) · released 2025-07-28GLM 4.5V (Novita) — output 3× input (median of 2 offers) · released 2025-08-11GLM 4.6 (Venice) — output 4× input (median of 5 offers) · released 2025-09-30GLM 4.6V (Novita) — output 3× input (median of 2 offers) · released 2025-12-08GLM 4.7 (DeepInfra) — output 3.7× input (median of 6 offers) · released 2025-12-22GLM 4.7 Flash (Venice) — output 6.6× input (median of 4 offers) · released 2026-01-19GLM 5 (GMICloud) — output 3.2× input (median of 9 offers) · released 2026-02-12GLM 5.1 (Baidu) — output 3.1× input (median of 15 offers) · released 2026-04-07GLM 5.2 (Baidu) — output 3.1× input (median of 21 offers) · released 2026-06-13GLM 5.3 (Reka) — output 3.1× input (median of 19 offers) · released 2026-08-14GLM 5.3 Flash (Relace) — output 3.3× input (median of 19 offers) · released 2026-08-26GPT-4o — output 4× input (median of 1 offer) · released 2024-05-13GPT-4o mini — output 4× input (median of 1 offer) · released 2024-07-18GPT-4.1 mini — output 4× input (median of 1 offer) · released 2025-04-14gpt-oss-20b (AkashML) — output 4.1× input (median of 12 offers) · released 2025-08-05gpt-oss-120b (AkashML) — output 4.5× input (median of 16 offers) · released 2025-08-05GPT-5.6 Sol (OpenAI) — output 5× input (median of 3 offers) · released 2026-07-09GPT-5.6 Terra (OpenAI) — output 6× input (median of 3 offers) · released 2026-07-09GPT-5.6 Luna (OpenAI) — output 6× input (median of 3 offers) · released 2026-07-09GPT-6 Astra (OpenAI) — output 5× input (median of 1 offer) · released 2026-09-03Gemma 3 27B (DeepInfra) — output 2.5× input (median of 4 offers) · released 2025-03-12Gemma 4 31B (CoreWeave) — output 2.9× input (median of 12 offers) · released 2026-04-02Gemma 4 26B A4B (Cloudflare) — output 3.1× input (median of 7 offers) · released 2026-04-02Gemini 3.6 Flash — output 5× input (median of 1 offer) · released 2026-07-21Gemini 3.5 Flash Lite (Google) — output 8.3× input (median of 1 offer) · released 2026-07-21Gemini 3.7 Flash (Google) — output 5× input (median of 1 offer) · released 2026-08-13Gemini 3.8 Flash (Google) — output 5× input (median of 1 offer) · released 2026-09-02Llama 3.1 8B (DeepInfra) — output 1.9× input (median of 5 offers) · released 2024-07-23Llama 3.1 70B Instruct (DeepInfra) — output 1× input (median of 3 offers) · released 2024-07-23Llama 3.2 3B Instruct (Parasail) — output 6.6× input (median of 2 offers) · released 2024-09-18Llama 3.3 70B (DeepInfra) — output 2.4× input (median of 12 offers) · released 2024-12-06Llama 4 Scout (DeepInfra) — output 3× input (median of 3 offers) · released 2025-04-05Llama 4 Maverick (DigitalOcean) — output 3.3× input (median of 5 offers) · released 2025-04-05MiniMax M1 (Minimax) — output 4.8× input (median of 2 offers) · released 2025-06-17MiniMax M2 (Minimax) — output 4× input (median of 3 offers) · released 2025-10-27MiniMax M2.1 (Novita) — output 6× input (median of 2 offers) · released 2025-12-23MiniMax M2.5 (Venice) — output 4× input (median of 7 offers) · released 2026-02-12MiniMax M2.7 (Novita) — output 4× input (median of 7 offers) · released 2026-03-18MiniMax M3 (CoreWeave) — output 4× input (median of 9 offers) · released 2026-06-01Kimi K2 Thinking (Google) — output 4.2× input (median of 2 offers) · released 2025-11-06Kimi K2.5 (SiliconFlow) — output 5× input (median of 8 offers) · released 2026-01-27Kimi K2.6 (Baidu) — output 4.2× input (median of 17 offers) · released 2026-04-21Kimi K2.7 Code (DeepInfra) — output 4.2× input (median of 11 offers) · released 2026-06-12Kimi K3 (DeepInfra) — output 5× input (median of 12 offers) · released 2026-07-16Claude Fable 5 (Anthropic) — output 5× input (median of 3 offers) · released 2026-06-09Claude Sonnet 5 (Anthropic) — output 5× input (median of 3 offers) · released 2026-06-30Claude Opus 5 (Anthropic) — output 5× input (median of 3 offers) · released 2026-07-24Claude Fable 5.1 (Anthropic) — output 5× input (median of 3 offers) · released 2026-09-01Nemotron 3 Nano 30B A3B (Crusoe) — output 4× input (median of 4 offers) · released 2025-12-15Nemotron 3 Super (DeepInfra) — output 3.4× input (median of 2 offers) · released 2026-03-11Nemotron 3 Ultra (DeepInfra) — output 4.4× input (median of 3 offers) · released 2026-06-04Nemotron 3.5 Lightning (DeepInfra) — output 2.5× input (median of 2 offers) · released 2026-08-11Command R (Cohere) — output 4× input (median of 1 offer) · released 2024-08-30Command A (Cohere) — output 4× input (median of 1 offer) · released 2025-03-13Grok 4.5 (xAI) — output 3× input (median of 2 offers) · released 2026-07-08Grok 4.6 (xAI) — output 3× input (median of 2 offers) · released 2026-08-12Granite 4.2 8B (CoreWeave) — output 2.8× input (median of 2 offers) · released 2026-08-31

Trim output, not input

A chatbot workload (1,000 in / 500 out,1,000 requests) on MiniMax M3 (DeepInfra)(DeepInfra) — a typical 3.9× output premium. Baseline: $0.83. Now cut 30% off one side:

Cut 30% of output
−$0.16
now $0.67
Cut 30% of input
−$0.08
now $0.75

Same 30% cut, but trimming the response saves 2.0× more. Tighten max_tokens, ask for terse answers, or stream-and-stop — it moves the bill more than shrinking the prompt.

Try it — trim output30% · trim input0%  →  cost $0.67()

Highest output premiums

Endpoints where output is priced furthest above input — where response length matters most.

ModelProviderInput /1MOutput /1MPremium
Qwen3 Next 80B A3B Instruct (DeepInfra)DeepInfra$0.090$1.10012.2×
Qwen3 VL 30B A3B Thinking (Alibaba)Alibaba$0.200$2.40012×
Qwen3 Next 80B A3B Instruct (Parasail)Parasail$0.100$1.10011×
Qwen3.6 27B (SiliconFlow)SiliconFlow$0.300$3.20010.7×
Qwen3.8 27B (Reka)Reka$0.240$2.55010.6×
Qwen3.6 35B A3B (Venice)Venice$0.100$1.00010×
Qwen3.6 27B (DeepInfra)DeepInfra$0.320$3.20010×
Qwen3.6 27B (Venice)Venice$0.325$3.25010×
Qwen3.5-27B (DeepInfra)DeepInfra$0.260$2.60010×
Qwen3 Next 80B A3B Instruct (Novita)Novita AI$0.150$1.50010×
Qwen3 235B A22B Thinking 2507 (Novita)Novita AI$0.300$3.00010×
Qwen3 VL 235B A22B Thinking (Alibaba)Alibaba$0.400$4.00010×
Qwen3 235B A22B Thinking 2507 (Alibaba)Alibaba$0.230$2.30010×
Qwen3.6 35B A3B (DeepInfra)DeepInfra$0.100$0.9509.5×
Qwen3.8 27B (Parasail)Parasail$0.240$2.2009.2×
Qwen3 VL 235B A22B Instruct (Venice)Venice$0.210$1.900
Qwen3 VL 235B A22B Instruct (Parasail)Parasail$0.210$1.900
gpt-oss-120b (SiliconFlow)SiliconFlow$0.050$0.450
Qwen3.6 35B A3B (AkashML)AkashML$0.100$0.900
Qwen3.8 27B (AkashML)AkashML$0.250$2.2008.8×

Prices per 1M tokens (USD), from each provider's published input/output rates. Verified 2026-09-05.

FAQ

Do input and output tokens cost the same?

No. Across 538 priced endpoints, the median output-token price is 3.91× the input-token price. Generated tokens are the expensive side of the bill.

What's the cheapest way to cut an LLM API bill?

Usually to make the model say less, not to feed it less. Because output is priced about 3.91× input, trimming the response — tighter max_tokens, terse answers, stream-and-stop — moves the bill more than shrinking the prompt.

Why is output priced higher than input?

Output tokens are generated one at a time, each needing a full forward pass, while input tokens are processed in parallel during prefill. That compute asymmetry is passed through into per-token pricing.