No design phase. Each agent gets a real production library and one instruction: use it, and write as little code as possible.
ModelScore ± 95% CI$ / problem
Opus 5.5mini-SWE
$0.664Opus 5mini-SWE
$1.314DeepSeek V4.1 Flashmini-SWE
$0.190GPT-5.6 Terramini-SWE
$0.239Sonnet 5mini-SWE
$0.919GLM 5.3 Flashmini-SWE
$0.192DeepSeek V4 Flashmini-SWE
$0.286GPT-5.6 Lunamini-SWE
$0.042Muse Spark 1.3mini-SWE
$1.940Note: Scores run 0–100: pass rate² × simplicity, averaged over every problem, with problems weighted equally. The error bars and ± show the 95% confidence interval.