Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Task Generation on red-wine benchmark
Loading...
61.84
Utility
gpt-5.4
54.976
56.758
58.54
60.322
May 8, 2026
Utility
Latency (s)
API Cost ($)
Avg Raw Proposals / Trigger
Updated 2mo ago
Evaluation Results
Method
Method
Links
Utility
Latency (s)
API Cost ($)
Avg Raw Proposals / Trigger
gpt-5.4
generator_model=gpt-5.4
2026.05
61.84
60
40
4.8
gpt-5.4-mini
generator_model=gpt-5....
2026.05
60.79
28
12
5.2
gpt-5.4-nano-reasoning-high
generator_model=gpt-5....
2026.05
60.47
24
4.9
5.2
gpt-5.4-nano-reasoning-low
generator_model=gpt-5....
2026.05
60.02
15
3.6
5.3
gpt-5.4-nano
generator_model=gpt-5....
2026.05
59.8
12
3.27
5.5
gpt-4o-mini
generator_model=gpt-4o...
2026.05
58.04
21
2
6.6
SH
2026.05
56.46
-
-
-
random
2026.05
56.02
-
-
-
hyperband
2026.05
55.24
-
-
-
Feedback
Search any
task
Search any
task