Smallest readable coding-agent harness that scores on benchmarks. ~970 lines, 59.6% on Terminal-Bench 2.0.
benchmark benchmarks software-engineering software-development benchmark-framework software-testing harness harness-framework harness-engineering harness-design harness-ai terminal-bench-3 harness-testing frontier-model-evaluation
-
Updated
Sep 6, 2026 - Python