Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-agent debate on Mixed regime
Loading...
72.4
Accuracy
Flat
66.888
68.319
69.75
71.181
Jun 17, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
Flat
Model=gpt-oss-120b
2026.06
72.4
MAD
Model=gpt-oss-120b
2026.06
72.2
Transformational leadership controller
Model=gpt-oss-120b
2026.06
71.8
Situational leadership controller
Model=gpt-oss-120b
2026.06
71.6
R0-vote
Model=gpt-oss-120b
2026.06
71.3
MAD
Model=llama-4-scout
2026.06
71.3
Flat
Model=llama-4-scout
2026.06
71.1
Situational leadership controller
Model=llama-4-scout
2026.06
70.7
Transformational leadership controller
Model=llama-4-scout
2026.06
69.6
Situational leadership controller
Model=gemma-4-31B-it
2026.06
69.6
R0-vote
Model=llama-4-scout
2026.06
69.3
Transformational leadership controller
Model=gemma-4-31B-it
2026.06
69.1
MAD
Model=gemma-4-31B-it
2026.06
68
R0-vote
Model=gemma-4-31B-it
2026.06
67.8
Flat
Model=gemma-4-31B-it
2026.06
67.1
Feedback
Search any
task
Search any
task