PRICE~moonshotai/kimi-latest cached_input_per_mtok decreased from 0.80 to 0.295mPRICE~moonshotai/kimi-latest output_per_mtok decreased from 13.00 to 11.365mPRICE~moonshotai/kimi-latest input_per_mtok decreased from 0.99 to 0.755mPRICE~deepseek/deepseek-pro-latest cached_input_per_mtok increased from 0.0042 to 0.105mPRICE~deepseek/deepseek-pro-latest output_per_mtok increased from 0.40 to 4.205mPRICE~deepseek/deepseek-pro-latest input_per_mtok decreased from 0.13 to 0.135mPRICE~moonshotai/kimi-latest cached_input_per_mtok increased from 0.29 to 0.8035mPRICE~moonshotai/kimi-latest output_per_mtok increased from 11.36 to 13.0035mPRICE~moonshotai/kimi-latest input_per_mtok increased from 0.75 to 0.9935mPERFORMANCEGLM-5.2 → Scaleway: TTFT ↑ 20%1hPERFORMANCEDeepSeek V4 Flash → Scaleway: TTFT ↑ 35%1hPERFORMANCEMistral Medium 3.5 → Scaleway: TTFT ↓ 21%1hPERFORMANCEDeepSeek V4 Flash → Scaleway: throughput ↓ 20%1hPERFORMANCEGPT-OSS 120B → Scaleway: throughput ↑ 31%1hPERFORMANCEGPT-OSS 120B → Scaleway: TTFT ↓ 24%1hPERFORMANCEGPT-OSS 120B → Together AI: throughput ↑ 20%1hPERFORMANCEKimi K3 via OpenRouter: TTFT ↓ 49%1hPERFORMANCEGLM-5.2 via OpenRouter: reliability recovered 96.8% → 100.0%1hPERFORMANCEKimi K3 via Cortecs: throughput ↑ 184%1hPERFORMANCEKimi K3 via Cortecs: TTFT ↓ 42%1hPERFORMANCEGLM-5.2 via OpenRouter: throughput ↓ 49%1hPERFORMANCEGLM-5.2 via OpenRouter: TTFT ↑ 121%1hPERFORMANCEMiniMax M3 via OpenRouter: reliability recovered 96.8% → 100.0%1hPERFORMANCEDeepSeek V4 Pro via Cortecs: throughput ↑ 27%1hPERFORMANCEGPT-OSS 120B via OpenRouter: throughput ↓ 22%1hPERFORMANCEGLM-4.7 via OpenRouter: TTFT ↓ 78%1hPERFORMANCEGPT-OSS 20B → Groq: TTFT ↑ 24%1hPERFORMANCEKimi K3 → Together AI: TTFT ↓ 34%1hPERFORMANCEDeepSeek V4 Flash via OpenRouter: throughput ↓ 17%1hPERFORMANCELlama 3.3 70B via Cortecs: TTFT ↓ 51%1hPERFORMANCEQwen3 235B via OpenRouter: throughput ↑ 37%1hPERFORMANCEQwen3 235B via OpenRouter: TTFT ↓ 29%1hPERFORMANCEDeepSeek V4 Flash → Together AI: throughput ↑ 19%1hPERFORMANCEGLM-5.3 via OpenRouter: throughput ↓ 17%1hPERFORMANCEGPT-OSS 20B via Cortecs: throughput ↑ 28%1hPERFORMANCELlama 3.3 70B → Together AI: TTFT ↓ 33%1hPRICE~moonshotai/kimi-latest cached_input_per_mtok decreased from 0.80 to 0.291hPRICE~moonshotai/kimi-latest output_per_mtok decreased from 13.00 to 11.361hPRICE~moonshotai/kimi-latest input_per_mtok decreased from 0.99 to 0.751hPRICE~deepseek/deepseek-v4-flash-latest cached_input_per_mtok decreased from 0.0077 to 0.00111h

Best inference providers for realtime chat

Benchmarked for time-to-first-token, p95 tail latency, streaming stability and availability.

Provider ranking for Realtime

#ProviderΔ30d
01CerebrasBEST OVERALL● MEASUREDUS · Serverless · 1 model · 1 region100.0%100.0%100.0%1843230.4s1749P88↑ 0.0
02GroqBEST VALUE● MEASUREDUS · Serverless · 2 models · 1 region100.0%100.0%100.0%2623840.9s708P100↑ 0.1
03MistralBEST EUROPEANEU RESIDENT● MEASUREDFR · Serverless · 2 models · 1 region100.0%100.0%91.7%30710094.4s109P25—
04CortecsEU RESIDENTEU OWNED● MEASUREDAT · Routed · 11 models · 1 region99.9%99.6%98.3%42512545.0s125P75↑ 5.0
05ScalewayEU RESIDENTEU OWNED● MEASUREDFR · Serverless · 6 models · 1 region100.0%100.0%100.0%17212344.7s93P38↑ 4.8
06Together● MEASUREDUS · Serverless · 6 models · 1 region98.5%99.7%96.8%57216254.0s130P63↑ 4.7
07OpenAISOLE SERVER● MEASUREDUS · Serverless · 2 models · 1 region100.0%100.0%100.0%104024535.4s96P13—
08OpenRouter● MEASUREDUS · Routed · 13 models · 2 regions99.5%99.9%96.4%65630276.0s91P50↑ 3.3
8 of 18 providers ranked · · Methodology →
01Cerebras99.0
Best overallUS · Serverless · 1 model · 1 region
TTFT184 ms
Rel.100.0%
Tok/s1749
$ Out$0.75
Tools100.0%
Δ30d0.0
View dossier
02Groq94.3
Best valueUS · Serverless · 2 models · 1 region
TTFT262 ms
Rel.100.0%
Tok/s708
$ Out$0.45
Tools100.0%
Δ30d+0.1
View dossier
03Mistral89.7
Best EuropeanFR · Serverless · 2 models · 1 region
TTFT307 ms
Rel.100.0%
Tok/s109
$ Out$4.50
Tools100.0%
Δ30d—
View dossier
04Cortecs83.1
AT · Routed · 11 models · 1 region
TTFT425 ms
Rel.99.9%
Tok/s125
$ Out$1.23
Tools99.6%
Δ30d+5.0
View dossier
05Scaleway82.5
FR · Serverless · 6 models · 1 region
TTFT172 ms
Rel.100.0%
Tok/s93
$ Out$1.81
Tools100.0%
Δ30d+4.8
View dossier
06Together80.7
US · Serverless · 6 models · 1 region
TTFT572 ms
Rel.98.5%
Tok/s130
$ Out$1.12
Tools99.7%
Δ30d+4.7
View dossier
07OpenAI75.7
US · Serverless · 2 models · 1 region
TTFT1040 ms
Rel.100.0%
Tok/s96
$ Out$15.60
Tools100.0%
Δ30d—
View dossier
US · Routed · 13 models · 2 regions
TTFT656 ms
Rel.99.5%
Tok/s91
$ Out$1.20
Tools99.9%
Δ30d+3.3
View dossier
8 of 18 providers ranked · · Methodology →
Best inference providers for realtime chat · InferenceBench