Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Safe Reinforcement Learning on FormulaOne (L0)
Loading...
64.3
JR
PPOLag-Decoupled
-0.908
16.021
32.95
49.879
Jun 9, 2026
JR
JC
Updated 1mo ago
Evaluation Results
Method
Method
Links
JR
JC
PPOLag-Decoupled
Type=Ours (CMDP+VLM co...
2026.06
64.3
0
VLMPPOLag
Type=Ours (CMDP+VLM co...
2026.06
64.3
0
CPO-Decoupled
Type=Ours (CMDP+VLM co...
2026.06
64.1
0
PPO-CLG
Type=CLG (VLM-as-rewar...
2026.06
51.9
0
CPO-CLG
Type=CLG (VLM-as-rewar...
2026.06
51.7
0
VLMPPOLag+Conf*
Type=Ours (CMDP+VLM co...
2026.06
44.5
0
CPO-Coupled
Type=Ours (CMDP+VLM co...
2026.06
21.2
0
CPO
Type=CMDP (no VLM), Se...
2026.06
1.9
0
PPO
Type=RL (pure RL), See...
2026.06
1.6
0
PPOLag
Type=CMDP (no VLM), Se...
2026.06
1.6
0
Feedback
Search any
task
Search any
task