Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
In-Context Reinforcement Learning on Miniworld environment ε = 0.4 (test)
Loading...
123.5
Average Episode Reward
PPO
68.068
82.459
96.85
111.241
Jun 7, 2025
Average Episode Reward
Updated 1mo ago
Evaluation Results
Method
Method
Links
Average Episode Reward
PPO
Attacker Type=Clean Env.
2025.06
123.5
AT-DPT
Attacker Type=DPT
2025.06
116.8
AT-DPT
Attacker Type=Clean Env.
2025.06
112.7
DPT
Attacker Type=Clean Env.
2025.06
110
AT-DPT
Attacker Type=Unif. Ra...
2025.06
108.6
AT-DPT
Attacker Type=AT-DPT
2025.06
104.8
DPT
Attacker Type=Unif. Ra...
2025.06
102.7
PPO
Attacker Type=Unif. Ra...
2025.06
92.9
PPO
Attacker Type=DPT
2025.06
83.8
PPO
Attacker Type=AT-DPT
2025.06
83.5
DPT
Attacker Type=AT-DPT
2025.06
81.2
DPT
Attacker Type=DPT
2025.06
70.2
Feedback
Search any
task
Search any
task