Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
MT-Bench Real-data 20% verified Evaluation
Loading...
77.82
Original Accuracy
Logistic Regression
73.929
75.8745
77.82
79.7655
Jun 18, 2026
Original Accuracy
Adjusted Accuracy
Accuracy Gain
Human Verification Requirement
Updated 1mo ago
Evaluation Results
Method
Method
Links
Original Accuracy
Adjusted Accuracy
Accuracy Gain
Human Verification Requirement
Logistic Regression
Model=GPT-5.4-mini, Da...
2026.06
77.82
75.39
-2.43
513
Multilayer Perceptron
Model=GPT-5.4-mini, Da...
2026.06
77.82
77.66
-0.16
513
Random Forest
Model=GPT-5.4-mini, Da...
2026.06
77.82
77.28
-0.54
513
Label Propagation
Model=GPT-5.4-mini, Da...
2026.06
77.82
76.74
-1.07
513
nnPU
Model=GPT-5.4-mini, Da...
2026.06
77.82
77.83
0.01
513
AURA
Model=GPT-5.4-mini, Da...
2026.06
77.82
81.01
3.19
87.4
Feedback
Search any
task
Search any
task