Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Deception Detection on MASK
Loading...
0.822
AUROC
STATEWITNESS
0.38416
0.49783
0.6115
0.72517
Jun 16, 2026
AUROC
Updated 1mo ago
Evaluation Results
Method
Method
Links
AUROC
STATEWITNESS
Target Model=GPT-OSS-20B
2026.06
0.822
LLM-as-a-Judge w/ CoT
Target Model=GEMMA4-26...
2026.06
0.815
Self-Evaluation
Target Model=GPT-OSS-20B
2026.06
0.794
STATEWITNESS
Target Model=GEMMA4-26...
2026.06
0.745
LLM-as-a-Judge
Target Model=GEMMA4-26...
2026.06
0.692
Self-Evaluation
Target Model=GEMMA4-26...
2026.06
0.691
LLM-as-a-Judge w/ CoT
Target Model=GPT-OSS-20B
2026.06
0.678
LLM-as-a-Judge
Target Model=GPT-OSS-20B
2026.06
0.656
LAT probe
Target Model=GEMMA4-26...
2026.06
0.631
LR probe
Target Model=GEMMA4-26...
2026.06
0.609
CMMS probe
Target Model=GEMMA4-26...
2026.06
0.566
LR probe
Target Model=GPT-OSS-20B
2026.06
0.557
MMS probe
Target Model=GPT-OSS-20B
2026.06
0.544
MMS probe
Target Model=GEMMA4-26...
2026.06
0.538
CMMS probe
Target Model=GPT-OSS-20B
2026.06
0.492
LAT probe
Target Model=GPT-OSS-20B
2026.06
0.401
Feedback
Search any
task
Search any
task