Models
Models are inputs to the benchmark — pick one to see who runs it best. 15 benchmarked, 471 observed across the registry.
Benchmarked models
Observed across the registry
gpt-oss-120bgpt-5.6-lunagpt-5.6-solopenai/gpt-oss-120bdeepseek-v4-flash-0731deepseek-v4-prodeepseek-v4-pro-0813glm-4.7-flashglm-5.2glm-5.3glm-5.3-flashgpt-oss-20bkimi-k3llama-3.3-70b-instructminimax-m3qwen3-235b-a22b-instruct-2507openai/gpt-oss-20bmistral-medium-3-5deepseek-ai/DeepSeek-V4-Flash-0731deepseek-ai/DeepSeek-V4-Prodeepseek-ai/DeepSeek-V4-Pro-0813MiniMaxAI/MiniMax-M3moonshotai/Kimi-K3Qwen/Qwen3-235B-A22B-Instruct-2507zai-org/GLM-5.2zai-org/GLM-5.3zai-org/GLM-5.3-Flash~deepseek/deepseek-v4-flash-latestdeepseek/deepseek-v4-flashdeepseek/deepseek-v4-flash-0731deepseek/deepseek-v4-flash-vision-expdeepseek/deepseek-v4-prodeepseek/deepseek-v4-pro-0813
claude-opus-5
claude-sonnet-5
codestral-2508