PRICE~deepseek/deepseek-v4-flash-latest cached_input_per_mtok decreased from 0.0077 to 0.001118mPRICE~deepseek/deepseek-v4-flash-latest output_per_mtok decreased from 1.28 to 1.0418mPRICE~deepseek/deepseek-v4-flash-latest input_per_mtok decreased from 0.0077 to 0.003818mPRICE~deepseek/deepseek-flash-latest cached_input_per_mtok decreased from 0.02 to 0.002118mPRICE~deepseek/deepseek-flash-latest output_per_mtok increased from 0.60 to 0.6818mPRICE~deepseek/deepseek-flash-latest input_per_mtok decreased from 0.02 to 0.01518mPRICEdeepseek/deepseek-v4.1-flash cached_input_per_mtok decreased from 0.02 to 0.002118mPRICEdeepseek/deepseek-v4.1-flash output_per_mtok increased from 0.60 to 0.6818mPRICEdeepseek/deepseek-v4.1-flash input_per_mtok decreased from 0.02 to 0.01518mPRICEdeepseek/deepseek-v4-flash-0731 cached_input_per_mtok increased from 0.0077 to 0.01718mPRICEdeepseek/deepseek-v4-flash-0731 input_per_mtok increased from 0.0077 to 0.01718mPRICE~deepseek/deepseek-v4-flash-latest cached_input_per_mtok decreased from 0.012 to 0.007749mPRICE~deepseek/deepseek-v4-flash-latest input_per_mtok decreased from 0.012 to 0.007749mPRICEdeepseek/deepseek-v4-flash-0731 cached_input_per_mtok decreased from 0.012 to 0.007749mPRICEdeepseek/deepseek-v4-flash-0731 input_per_mtok decreased from 0.012 to 0.007749mPRICEdeepseek/deepseek-v3.1-terminus input_per_mtok decreased from 0.30 to 0.2749mPRICE~deepseek/deepseek-v4-flash-latest cached_input_per_mtok increased from 0.0011 to 0.0121hPRICE~deepseek/deepseek-v4-flash-latest output_per_mtok increased from 0.60 to 1.281hPRICE~deepseek/deepseek-v4-flash-latest input_per_mtok decreased from 0.013 to 0.0121hPRICEdeepseek/deepseek-v4-flash-0731 cached_input_per_mtok decreased from 0.017 to 0.0121hPRICEdeepseek/deepseek-v4-flash-0731 input_per_mtok decreased from 0.017 to 0.0121hNEW MODELnvidia/switchyard appeared in the catalogue1hPRICE~deepseek/deepseek-v4-flash-latest output_per_mtok decreased from 1.04 to 0.602hPRICE~deepseek/deepseek-v4-flash-latest input_per_mtok increased from 0.0038 to 0.0132hPRICEnvidia/nemotron-3-ultra-550b-a55b cached_input_per_mtok decreased from 0.12 to 0.102hPRICEnvidia/nemotron-3-ultra-550b-a55b output_per_mtok decreased from 2.40 to 2.202hPRICEnvidia/nemotron-3-ultra-550b-a55b input_per_mtok decreased from 0.60 to 0.502hPRICEdeepseek/deepseek-v4-flash-0731 cached_input_per_mtok increased from 0.0051 to 0.0172hPRICEdeepseek/deepseek-v4-flash-0731 input_per_mtok increased from 0.0051 to 0.0172hPRICE~moonshotai/kimi-latest cached_input_per_mtok decreased from 0.80 to 0.292hPRICE~moonshotai/kimi-latest output_per_mtok decreased from 13.00 to 11.362hPRICE~moonshotai/kimi-latest input_per_mtok decreased from 1.39 to 1.002hPRICE~deepseek/deepseek-v4-flash-latest output_per_mtok increased from 0.95 to 1.042hPRICE~deepseek/deepseek-v4-flash-latest input_per_mtok decreased from 0.0058 to 0.00382hPRICEinclusionai/ling-3.0-flash-fin cached_input_per_mtok decreased from 0.012 to 0.00842hPRICEinclusionai/ling-3.0-flash-fin output_per_mtok decreased from 0.18 to 0.122hPRICEinclusionai/ling-3.0-flash-fin input_per_mtok decreased from 0.06 to 0.0422hPRICEdeepseek/deepseek-v4-flash-0731 cached_input_per_mtok decreased from 0.0077 to 0.00512hPRICEdeepseek/deepseek-v4-flash-0731 input_per_mtok decreased from 0.0077 to 0.00512hPRICE~z-ai/glm-flash-latest output_per_mtok increased from 0.60 to 0.933h

Cerebras — AI inference benchmarks

US · serverless · 1 benchmarked model · 1 region
#1 GLOBALAdd to compare
Overall99.0Rel.100.0%Tools100.0%JSON100.0%TTFT184 msP95323 msTok/s1749Price$0.35 / $0.75Δ30d↑ 0.0● last run 18h ago · 8 runs in 24h

Head-to-head: vs Groq · vs OpenRouter · vs Cortecs · vs Together · vs Scaleway

Provider vs market

Percentile across 8 ranked providers
Reliability 100.0%P100
Tools 100.0%P100
Structured 100.0%P100
TTFT 184 msP88
Throughput 1749 tok/sP100
Cost $0.75P88

Price vs performance

Cerebras highlighted vs peers
879196100$4.37$8.74$13.10$17.47Output price $/M →Score ↑Cerebras — $0.75/M out · score 99.0CerebrasGroq — $0.45/M out · score 98.2Mistral — $4.50/M out · score 93.2Scaleway — $1.81/M out · score 92.4Cortecs — $1.23/M out · score 92.1OpenAI — $15.60/M out · score 90.4Together — $1.12/M out · score 85.7OpenRouter — $1.20/M out · score 84.3

30-day trend

Measured daily series
Score99.0
TTFT184 ms
Tools100.0%
Reliability100.0%
Price$0.75

Key positioning

Derived from benchmark percentiles
Strengths
  • Reliability (P100)
  • Tools (P100)
  • Structured (P100)
  • TTFT (P88)
  • Throughput (P100)
  • Cost (P88)
Weaknesses
  • No P40-or-below metric
Best suited for

Cerebras in the registry

  • HeadquartersUS
  • API protocolsopenai chat completions
  • Catalogued endpoints1
  • Websitewww.cerebras.ai
  • Last verified2026-10-02

Observed models & declared pricing

Read from Cerebras's own catalogue by continuous discovery — declared data, not benchmark results.

ModelObserved
gpt-oss-120b2026-10-02
qwen-3.8-27b2026-10-02

All providers · How we benchmark