Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Shell-based agent task completion on Terminal-Bench V2
Loading...
86.5
Accuracy
LLM-as-a-Verifier
79.948
81.649
83.35
85.051
Jul 6, 2026
Accuracy
Pass@1
Oracle Success Rate
Updated 19d ago
Evaluation Results
Method
Method
Links
Accuracy
Pass@1
Oracle Success Rate
LLM-as-a-Verifier
Verifier=Gemini 2.5 Fl...
2026.07
86.5
-
-
GPT-5.5
Baseline Rank=#1
2026.07
84.7
-
-
Opus 4.7
Baseline Rank=#2
2026.07
80.2
-
-
G3.1 Pro
Baseline Rank=#3
2026.07
80.2
-
-
GPT-5.5 (Candidate Pool)
Scaffold=Capy
2026.07
-
83.1
92.1
Feedback
Search any
task
Search any
task