Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Preference-Aligned Reinforcement Learning on Straighten Rope Pass Water

4.1Label Count

PrefVLM

0.0441.0972.153.203Jul 2, 2026
Updated 23d ago

Evaluation Results

MethodLinks
2026.07
4.10.4
2026.07
24
2026.07
0.90.9
2026.07
0.21.6