Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Prompt Optimization on Causal Judgment
Loading...
64.4
Accuracy
TRAS
58.368
59.934
61.5
63.066
Jul 14, 2025
Accuracy
p-value
Cohen's d
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
p-value
Cohen's d
TRAS
LLM=GPT-3.5-turbo, See...
2025.07
64.4
0.008
2.162
Baseline + TR
LLM=GPT-3.5-turbo, See...
2025.07
63.6
0.04
1.336
Baseline + MCSA
LLM=GPT-3.5-turbo, See...
2025.07
60.8
0.02
1.687
Baseline
LLM=GPT-3.5-turbo, See...
2025.07
58.6
-
-
Feedback
Search any
task
Search any
task