Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Safe Reinforcement Learning on FormulaOne (L1)
Loading...
64.1
JR
VLMPPOLag
-2.252
14.974
32.2
49.426
Jun 9, 2026
JR
JC
Updated 1mo ago
Evaluation Results
Method
Method
Links
JR
JC
VLMPPOLag
Type=Ours (CMDP+VLM co...
2026.06
64.1
32.8
PPOLag-Decoupled
Type=Ours (CMDP+VLM co...
2026.06
64
33.5
CPO-Decoupled
Type=Ours (CMDP+VLM co...
2026.06
63.7
37.6
PPO-CLG
Type=CLG (VLM-as-rewar...
2026.06
51.7
133.6
CPO-CLG
Type=CLG (VLM-as-rewar...
2026.06
50.7
32.8
VLMPPOLag+Conf*
Type=Ours (CMDP+VLM co...
2026.06
33.5
20.8
CPO-Coupled
Type=Ours (CMDP+VLM co...
2026.06
21
29.1
PPO
Type=RL (pure RL), See...
2026.06
1.6
217
PPOLag
Type=CMDP (no VLM), Se...
2026.06
0.8
67.9
PPOLag-RND
Type=RND (intrinsic-no...
2026.06
0.8
62.4
CPO
Type=CMDP (no VLM), Se...
2026.06
0.3
35.7
Feedback
Search any
task
Search any
task