PRICE~moonshotai/kimi-latest cached_input_per_mtok increased from 0.29 to 0.809mPRICE~moonshotai/kimi-latest output_per_mtok increased from 11.36 to 13.009mPRICE~moonshotai/kimi-latest input_per_mtok increased from 0.75 to 0.989mPRICE~deepseek/deepseek-pro-latest input_per_mtok decreased from 0.13 to 0.1340mPRICE~deepseek/deepseek-pro-latest output_per_mtok increased from 0.40 to 4.2040mPRICE~deepseek/deepseek-pro-latest cached_input_per_mtok increased from 0.0042 to 0.1040mPRICE~moonshotai/kimi-latest input_per_mtok decreased from 0.99 to 0.7540mPRICE~moonshotai/kimi-latest output_per_mtok decreased from 13.00 to 11.3640mPRICE~moonshotai/kimi-latest cached_input_per_mtok decreased from 0.80 to 0.2940mPRICE~moonshotai/kimi-latest input_per_mtok increased from 0.75 to 0.991hPRICE~moonshotai/kimi-latest output_per_mtok increased from 11.36 to 13.001hPRICE~moonshotai/kimi-latest cached_input_per_mtok increased from 0.29 to 0.801hPERFORMANCEGLM-5.2 → Scaleway: TTFT ↑ 20%2hPERFORMANCEDeepSeek V4 Flash → Scaleway: TTFT ↑ 35%2hPERFORMANCEMistral Medium 3.5 → Scaleway: TTFT ↓ 21%2hPERFORMANCEDeepSeek V4 Flash → Scaleway: throughput ↓ 20%2hPERFORMANCEGPT-OSS 120B → Scaleway: throughput ↑ 31%2hPERFORMANCEGPT-OSS 120B → Scaleway: TTFT ↓ 24%2hPERFORMANCEGPT-OSS 120B → Together AI: throughput ↑ 20%2hPERFORMANCEKimi K3 via OpenRouter: TTFT ↓ 49%2hPERFORMANCEGLM-5.2 via OpenRouter: reliability recovered 96.8% → 100.0%2hPERFORMANCEKimi K3 via Cortecs: throughput ↑ 184%2hPERFORMANCEKimi K3 via Cortecs: TTFT ↓ 42%2hPERFORMANCEGLM-5.2 via OpenRouter: throughput ↓ 49%2hPERFORMANCEGLM-5.2 via OpenRouter: TTFT ↑ 121%2hPERFORMANCEMiniMax M3 via OpenRouter: reliability recovered 96.8% → 100.0%2hPERFORMANCEDeepSeek V4 Pro via Cortecs: throughput ↑ 27%2hPERFORMANCEGPT-OSS 120B via OpenRouter: throughput ↓ 22%2hPERFORMANCEGLM-4.7 via OpenRouter: TTFT ↓ 78%2hPERFORMANCEGPT-OSS 20B → Groq: TTFT ↑ 24%2hPERFORMANCEKimi K3 → Together AI: TTFT ↓ 34%2hPERFORMANCEDeepSeek V4 Flash via OpenRouter: throughput ↓ 17%2hPERFORMANCELlama 3.3 70B via Cortecs: TTFT ↓ 51%2hPERFORMANCEQwen3 235B via OpenRouter: throughput ↑ 37%2hPERFORMANCEQwen3 235B via OpenRouter: TTFT ↓ 29%2hPERFORMANCEDeepSeek V4 Flash → Together AI: throughput ↑ 19%2hPERFORMANCEGLM-5.3 via OpenRouter: throughput ↓ 17%2hPERFORMANCEGPT-OSS 20B via Cortecs: throughput ↑ 28%2hPERFORMANCELlama 3.3 70B → Together AI: TTFT ↓ 33%2hPRICEtencent/hy4-preview output_per_mtok increased from 2.25 to 2.502h

ALIA Salamandra 40B

1 providers · 40B dense · — context · 1 regions · all models →
Not yet measured

No provider serving ALIA Salamandra 40B has been measured from the canonical vantage yet. Rows appear here with the first canonical benchmark run.

ALIA Salamandra 40B inference benchmark: fastest & cheapest providers · InferenceBench