Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Embodied Science Experiments on SciWorld Seen
Loading...
76.3
Average Accumulated Reward
Q-Evolve
0.9
20.475
40.05
59.625
Jun 5, 2026
Average Accumulated Reward
Updated 1mo ago
Evaluation Results
Method
Method
Links
Average Accumulated Reward
Q-Evolve
Backbone=Llama-2-7B-Chat
2026.06
76.3
QLASS
Backbone=Llama-2-7B-Chat
2026.06
75.3
ETO
Backbone=Llama-2-7B-Chat
2026.06
73.8
DMPO
Backbone=Llama-2-7B-Chat
2026.06
72.4
RFT
Backbone=Llama-2-7B-Chat
2026.06
71.6
Best-of-N
Backbone=Llama-2-7B-Ch...
2026.06
70.2
SFT
Backbone=Llama-2-7B-Chat
2026.06
67.4
GPT-4
Prompting=ReAct
2026.06
64.8
Reflexion
Prompting=ReAct
2026.06
60.3
PPO
Backbone=Llama-2-7B-Chat
2026.06
59.4
GPT-3.5-Turbo
Prompting=ReAct
2026.06
16.5
Base Agent
Backbone=Llama-2-7B-Chat
2026.06
3.8
Feedback
Search any
task
Search any
task