Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Agent on Terminal-Bench
Loading...
45
Accuracy
DeepSeek V3.2
4.7
15.1625
25.625
36.0875
Dec 1, 2025
Dec 30, 2025
Jan 29, 2026
Feb 27, 2026
Mar 29, 2026
Apr 27, 2026
May 27, 2026
Accuracy
Relative Gains
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
Relative Gains
DeepSeek V3.2
Evaluation Mode=Chat
2025.12
45
-
LongCat-Flash Exp-Chat
Evaluation Mode=Chat
2025.12
42.5
-
GLM 4.6
Evaluation Mode=Chat
2025.12
40.5
-
LongCat-Flash Chat
Evaluation Mode=Chat
2025.12
39.5
-
Reflection
Inference Method=Best-...
2026.05
25.8
-
LiTS-Fact
Inference Method=Best-...
2026.05
25.8
-
No Memory
Inference Method=Best-...
2026.05
23.6
-
PromptBridge
Model Role=Target Mode...
2025.12
18.75
25
Direct Transfer
Model Role=Target Mode...
2025.12
15
-
PromptBridge
Model Role=Target Mode...
2025.12
8.75
40
ReAct
Inference Method=Singl...
2026.05
7.9
-
Direct Transfer
Model Role=Target Mode...
2025.12
6.25
-
Feedback
Search any
task
Search any
task