Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Safe Reinforcement Learning on FormulaOne (L2)
Loading...
63.9
JR Score
CPO-Decoupled
-2.348
14.851
32.05
49.249
Jun 9, 2026
JR Score
JC Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
JR Score
JC Score
CPO-Decoupled
Type=Ours (CMDP+VLM co...
2026.06
63.9
30.9
PPOLag-Decoupled
Type=Ours (CMDP+VLM co...
2026.06
63.8
40.7
VLMPPOLag
Type=Ours (CMDP+VLM co...
2026.06
63.8
40.2
PPO-CLG
Type=CLG (VLM-as-rewar...
2026.06
51.3
156.6
CPO-CLG
Type=CLG (VLM-as-rewar...
2026.06
50.9
33.9
VLMPPOLag+Conf*
Type=Ours (CMDP+VLM co...
2026.06
31.8
22.5
CPO-Coupled
Type=Ours (CMDP+VLM co...
2026.06
21.6
32.4
PPO
Type=RL (pure RL), See...
2026.06
1.3
269.2
PPOLag
Type=CMDP (no VLM), Se...
2026.06
0.7
55.8
PPOLag-RND
Type=RND (intrinsic-no...
2026.06
0.4
45.7
CPO
Type=CMDP (no VLM), Se...
2026.06
0.3
36.1
CPPOPID
Type=CMDP (no VLM), Se...
2026.06
0.2
22.8
Feedback
Search any
task
Search any
task