Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Forecasting on Polymarket official (test)
Loading...
64.99
Score
Ours (GPT-5.4-medium)
33.582
41.736
49.89
58.044
Jun 19, 2026
Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
Score
Ours (GPT-5.4-medium)
Agent Architecture=mul...
2026.06
64.99
GPT-5.4-med-SC@5
Agent Architecture=mul...
2026.06
62.26
GPT-5.4-med-SC@3
Agent Architecture=mul...
2026.06
60.99
GLM-5 w/ tools
Agent Architecture=sin...
2026.06
59.24
GPT-5.4-medium w/ tools
Agent Architecture=sin...
2026.06
58.63
Gemini-3.1-Pro w/ tools
Agent Architecture=sin...
2026.06
58.45
Kimi-K2.5 w/ tools
Agent Architecture=sin...
2026.06
57.91
GPT-5.4-medium
Mode=closed-book, Tool...
2026.06
53.76
Claude-4.6-Sonnet w/ tools
Agent Architecture=sin...
2026.06
48.21
DeepSeek-V4-Flash w/ tools
Agent Architecture=sin...
2026.06
48.12
Claude-4.6-Sonnet
Mode=closed-book, Tool...
2026.06
47.97
Gemini-3.1-Pro
Mode=closed-book, Tool...
2026.06
43.38
Kimi-K2.5
Mode=closed-book, Tool...
2026.06
42.88
GLM-5
Mode=closed-book, Tool...
2026.06
41.18
DeepSeek-V4-Flash
Mode=closed-book, Tool...
2026.06
34.79
Feedback
Search any
task
Search any
task