Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Decision-making in interactive environments on ScienceWorld Llama-3.1 8B backbone (ID)
Loading...
67.61
Performance
Multi2
20.3628
32.6289
44.895
57.1611
Jun 2, 2026
Performance
Average Token Usage
Normalized Token Efficiency (TE)
Updated 1mo ago
Evaluation Results
Method
Method
Links
Performance
Average Token Usage
Normalized Token Efficiency (TE)
Multi2
Training Type=Fine-Tun...
2026.06
67.61
12,315.42
4.483
Glider
Training Type=Fine-Tun...
2026.06
60.48
14,716.87
3.356
GRPO
Training Type=Fine-Tun...
2026.06
33.2
11,145.44
2.433
ADaPT
Training Type=Prompt-B...
2026.06
26.2
32,449.12
0.659
ReAct
Training Type=Prompt-B...
2026.06
23.23
18,971.23
1
Reflexion
Training Type=Prompt-B...
2026.06
22.18
18,063.16
1.003
Feedback
Search any
task
Search any
task