Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Active Reasoning on AR-Bench-SP
Loading...
54
Non-strict Semantic Equivalence
BALAR
10.32
21.66
33
44.34
May 6, 2026
Non-strict Semantic Equivalence
Updated 2mo ago
Evaluation Results
Method
Method
Links
Non-strict Semantic Equivalence
BALAR
LLM Backbone=Qwen2.5-3...
2026.05
54
ToT
LLM Backbone=Qwen2.5-3...
2026.05
39
Few-Shot
LLM Backbone=Qwen2.5-3...
2026.05
37
Proactive CoT
LLM Backbone=Qwen2.5-3...
2026.05
36
ToT
LLM Backbone=Llama-3.1...
2026.05
31
UoT
LLM Backbone=Llama-3.1...
2026.05
29
BALAR
LLM Backbone=Llama-3.1...
2026.05
26
Proactive CoT
LLM Backbone=Llama-3.1...
2026.05
21
Few-Shot
LLM Backbone=Llama-3.1...
2026.05
20
UoT
LLM Backbone=Qwen2.5-3...
2026.05
12
Feedback
Search any
task
Search any
task