Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-agent debate on Closed regime
Loading...
87.7
Accuracy
MAD
77.3
80
82.7
85.4
Jun 17, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
MAD
Model=gpt-oss-120b
2026.06
87.7
Flat
Model=gpt-oss-120b
2026.06
87
R0-vote
Model=gpt-oss-120b
2026.06
86.3
Situational leadership controller
Model=gpt-oss-120b
2026.06
85.7
Transformational leadership controller
Model=gpt-oss-120b
2026.06
85.7
MAD
Model=gemma-4-31B-it
2026.06
80.7
Transformational leadership controller
Model=llama-4-scout
2026.06
80.3
Flat
Model=llama-4-scout
2026.06
79.7
Flat
Model=gemma-4-31B-it
2026.06
79.7
R0-vote
Model=llama-4-scout
2026.06
79
Situational leadership controller
Model=llama-4-scout
2026.06
79
MAD
Model=llama-4-scout
2026.06
78.3
R0-vote
Model=gemma-4-31B-it
2026.06
77.7
Situational leadership controller
Model=gemma-4-31B-it
2026.06
77.7
Transformational leadership controller
Model=gemma-4-31B-it
2026.06
77.7
Feedback
Search any
task
Search any
task