Compare top models

LLM Benchmarks

See how today's leading models write Spacetime code, scored task by task on live modules.

Leaderboard

ModelEval Pass% ▾CostRun TimeLast RunAuthBasicsData ModelingQueriesSchema
Claude Opus 4.80.0%$1.65264.5K tokens3m 46s2mo0.0%0.0%0.0%0.0%0.0%
Claude Sonnet 4.60.0%$0.74194.2K tokens3m 44s2mo0.0%0.0%0.0%0.0%0.0%
DeepSeek V4 Flash0.0%$0.01191.7K tokens7m 36s2mo0.0%0.0%0.0%0.0%0.0%
DeepSeek V4 Pro0.0%$0.04176.8K tokens6m 21s2mo0.0%0.0%0.0%0.0%0.0%
Gemini 3.1 Pro0.0%$1.04227.7K tokens9m 21s2mo0.0%0.0%0.0%0.0%0.0%
Gemini 3.5 Flash0.0%$0.38182.8K tokens1m 45s2mo0.0%0.0%0.0%0.0%0.0%
GPT-5.4-mini0.0%$0.16162.2K tokens1m 29s2mo0.0%0.0%0.0%0.0%0.0%
GPT-5.50.0%$1.58178.7K tokens7m 34s2mo0.0%0.0%0.0%0.0%0.0%
Grok 4.30.0%$0.31200.4K tokens5m 54s2mo0.0%0.0%0.0%0.0%0.0%
Grok Build 0.10.0%$0.42286.7K tokens19m 19s2mo0.0%0.0%0.0%0.0%0.0%