Share your thoughts, 1 month free Claude Pro on us
See more
Feedback
Search any
task
Search any
task
SOTA Policy Evaluation benchmarks and papers with code | Wizwand
Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Tasks
Policy Evaluation
Benchmarks
Dataset Name
SOTA Method
Dataset Name
SOTA Method
Metric
Trend
Results
Last Updated
PolicyBench Overall Average
Deepseek R1
Accuracy
66.34
11
3mo ago
PolicyBench Level 3 US
o4-mini
Accuracy
77
11
3mo ago
PolicyBench Level 3 CN
QwQ 32B
Accuracy
80.34
11
3mo ago
PolicyBench Level 2 (US)
Claude 3.5
Accuracy
68.95
11
3mo ago
PolicyBench Level 2 (CN)
Deepseek R1
Accuracy
62.92
11
3mo ago
PolicyBench Level 1 (US)
Deepseek R1
Accuracy
59.33
11
3mo ago
PolicyBench Level 1 (CN)
Deepseek R1
Accuracy
62.02
11
3mo ago
Out-of-distribution
SC3-Eval
Return (r)
96.2
8
1mo ago
In-distribution
SC3-Eval
r Score
98.4
8
1mo ago
20-Link Pole off-policy
BBO
Sum of sqrt MSE
415.37
7
5mo ago
400-State Random MDP on-policy
BBO
Sum of sqrt MSE
24.74
7
5mo ago
14-State Boyan Chain on-policy
LSTD+
Sum of sqrt MSE
25.06
7
5mo ago
20-Link Pole off-policy
BBO
MSE
4.17
7
5mo ago
20-Link Pole on-policy
BBO
MSE
4.26
7
5mo ago
Cart-Pole off-policy perfect features
BBO
MSE
0.17
7
5mo ago
Cart-Pole on-policy, perfect features
BBO
MSE
0.15
7
5mo ago
Cart-Pole off-policy, impoverished features
GTD2
MSE
2.33
7
5mo ago
Cart-Pole on-policy, impoverished features
GTD2
MSE
2.37
7
5mo ago
400-State Random MDP (off-policy)
BBO
MSE
0.11
7
5mo ago
400-State Random MDP on-policy
BBO
MSE
0.07
7
5mo ago
14-State Boyan Chain on-policy
LSTD+
MSE
0.1
7
5mo ago
BPIC real logs 2017
MDP-based RL method
Average KPI (Mπ)
1,731.108
6
1mo ago
BPIC real logs 2012
MDP-based RL method
Average KPI (Mπ)
374.966
6
1mo ago
2x2 Queueing Network rho = (0.95, 0.85)
Exact optimal
Expected Value
1,185.4
6
1mo ago
2x2 Queueing Network rho = (0.90, 0.90)
BTSD-PPO
Value
1,316.9
6
1mo ago
Showing 25 of 31 rows
25 / page
50 / page
100 / page
1
2
Search any
task
Search any
task
Privacy Policy
Terms of Service
FAQs
Swarm Docs