Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Chain-of-Thought Faithfulness Evaluation on BiasQA
Loading...
2.4
Unfaithful Explanation Rate
DPO + RMD
1.496
7.598
13.7
19.802
Apr 7, 2025
Unfaithful Explanation Rate
Updated 18d ago
Evaluation Results
Method
Method
Links
Unfaithful Explanation Rate
DPO + RMD
Reward Model=SK-LLAMA-...
2025.04
2.4
DPO + RMC
Reward Model=SK-LLAMA-...
2025.04
3.9
DPO + RMC
Reward Model=SK-LLAMA-...
2025.04
7.4
DPO + RMD
Reward Model=SK-GEMMA-...
2025.04
7.5
DPO + RMD
Reward Model=SK-LLAMA-...
2025.04
8
DPO + RM
Reward Model=SK-LLAMA-...
2025.04
9.8
DPO + RMD
Reward Model=SK-GEMMA-...
2025.04
10.7
DPO + RMC
Reward Model=SK-GEMMA-...
2025.04
11.7
DPO + RMC
Reward Model=SK-GEMMA-...
2025.04
12.3
DPO + RM
Reward Model=SK-LLAMA-...
2025.04
13.2
Base LLAMA-3.1-8B-IT
Reward Model=None, Dec...
2025.04
13.7
Base LLAMA-3.1-8B-IT
Reward Model=None, Dec...
2025.04
14.1
DPO + RM
Reward Model=SK-GEMMA-...
2025.04
20.8
DPO + RM
Reward Model=SK-GEMMA-...
2025.04
25
Feedback
Search any
task
Search any
task