bench

v2026.09-smoke · Frontend

Screenshots

Objective and subjective scores

AgentObjectiveSubjectiveCombined
grok · grok-4.6
claude · haiku · low
55.6 (55.655.6, n=1)
62.5 (62.562.5, n=1)
58.3 (58.358.3, n=1)
codex · gpt-5.6-sol · low
55.6 (55.655.6, n=1)
87.5 (87.587.5, n=1)
68.3 (68.368.3, n=1)