Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-agent debate on AlphaNLI
Loading...
93.7
Accuracy
R0-vote
86.732
88.541
90.35
92.159
Jun 17, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
R0-vote
Model=gpt-oss-120b
2026.06
93.7
Flat
Model=gemma-4-31B-it
2026.06
93.7
Flat
Model=gpt-oss-120b
2026.06
93
MAD
Model=gemma-4-31B-it
2026.06
93
Situational leadership controller
Model=gpt-oss-120b
2026.06
92.7
R0-vote
Model=gemma-4-31B-it
2026.06
92.7
MAD
Model=gpt-oss-120b
2026.06
92.3
Situational leadership controller
Model=gemma-4-31B-it
2026.06
92
Transformational leadership controller
Model=gemma-4-31B-it
2026.06
91.7
Transformational leadership controller
Model=gpt-oss-120b
2026.06
90.7
Situational leadership controller
Model=llama-4-scout
2026.06
89.7
Transformational leadership controller
Model=llama-4-scout
2026.06
88.3
MAD
Model=llama-4-scout
2026.06
87.3
R0-vote
Model=llama-4-scout
2026.06
87
Flat
Model=llama-4-scout
2026.06
87
Feedback
Search any
task
Search any
task