Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Reinforcement Learning on Ant v4

5,527Average Return

S-PLIF

-204.441,283.532,771.54,259.47Jan 29, 2026Feb 22, 2026Mar 18, 2026Apr 12, 2026May 6, 2026May 30, 2026Jun 24, 2026
Updated 1mo ago

Evaluation Results

MethodLinks
2026.01
5,527
2026.04
5,376
2026.01
5,259
2026.01
4,981
2026.01
4,932
2026.01
4,912
2026.06
4,652.1
2026.05
3,774.19
2026.03
3,568.2
2026.05
3,136.6
2026.05
2,915.64
2026.03
2,807.1
2026.03
2,589.5
2026.06
2,517.06
2026.06
2,193
2026.06
2,193
2026.03
2,002.5
2026.05
1,968.91
2026.05
1,451.34
2026.05
1,326.83
2026.06
1,185.26
2026.06
988.15
2026.05
940.26
2026.05
940.26
2026.06
159
2026.06
16