Compare top models

LLM Benchmarks

See how today's leading models write SpacetimeDB code, scored task by task on live modules.

Leaderboard

10 models
ModelEval Pass%ChecksCostRun TimeAuthBasicsData ModelingQueriesSchema
Gemini 3.1 Pro0.0%0/89$1.04227.7K tokens9m 21s0.0%0.0%0.0%0.0%0.0%
Claude Sonnet 4.60.0%0/89$0.74194.2K tokens3m 44s0.0%0.0%0.0%0.0%0.0%
GPT-5.4-mini0.0%0/89$0.16162.2K tokens1m 29s0.0%0.0%0.0%0.0%0.0%
GPT-5.50.0%0/89$1.58178.7K tokens7m 34s0.0%0.0%0.0%0.0%0.0%
Claude Opus 4.80.0%0/89$1.65264.5K tokens3m 46s0.0%0.0%0.0%0.0%0.0%
Grok 4.30.0%0/89$0.31200.4K tokens5m 54s0.0%0.0%0.0%0.0%0.0%
Gemini 3.5 Flash0.0%0/89$0.38182.8K tokens1m 45s0.0%0.0%0.0%0.0%0.0%
DeepSeek V4 Pro0.0%0/89$0.23176.8K tokens6m 21s0.0%0.0%0.0%0.0%0.0%
DeepSeek V4 Flash0.0%0/89$0.01191.7K tokens7m 36s0.0%0.0%0.0%0.0%0.0%
Grok Build 0.10.0%0/89$0.42286.7K tokens19m 19s0.0%0.0%0.0%0.0%0.0%