Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Agentic Terminal Interaction on Terminal-Bench v1
Loading...
47.5
Success Rate
Claude-Opus-4.5
3.3
14.775
26.25
37.725
Jun 16, 2026
Success Rate
Updated 1mo ago
Evaluation Results
Method
Method
Links
Success Rate
Claude-Opus-4.5
2026.06
47.5
Gemini-3-Pro
2026.06
46.3
Kimi-K2-Instruct-0905
2026.06
44.5
Qwen3-Coder-480B-A35B-Instruct
2026.06
37.5
GLM-4.7
2026.06
36.3
GPT-5.1
2026.06
35
LoopCoder-v2
R (number of refinemen...
2026.06
34.2
LoopCoder-v2
R (number of refinemen...
2026.06
30
LoopCoder-v2
R (number of refinemen...
2026.06
26.3
LoopCoder-v2
R (number of refinemen...
2026.06
26.3
DeepSeek-V3.2
2026.06
23.8
Qwen3-235B-A22B-Instruct-2507
2026.06
15
Qwen2.5-Coder-14B-Instruct
2026.06
8.8
Seed-Coder-8B-Instruct
2026.06
7.5
Qwen2.5-Coder-7B-Instruct
2026.06
6.3
DeepSeek-Coder-V2-Lite-Instruct
2026.06
5
Qwen2.5-Coder-32B-Instruct
2026.06
5
Feedback
Search any
task
Search any
task