Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
User-Agent Dialogue Evaluation on TRACE Hard Neg. (test)
Loading...
70
Accuracy
RM
-2.8
16.1
35
53.9
Oct 22, 2025
Accuracy
F1 Score
Precision
Recall
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
F1 Score
Precision
Recall
RM
LLM/RM=Skywork
2025.10
70
-
-
-
G-Eval
LLM/RM=GPT-4.1
2025.10
42
-
-
-
SCOPE
LLM/RM=GPT-4.1
2025.10
42
-
-
-
G-Eval
LLM/RM=Sonnet-3.5
2025.10
37
-
-
-
SCOPE
LLM/RM=Sonnet-3.5
2025.10
32
-
-
-
SPUR
LLM/RM=Sonnet-3.5
2025.10
2
-
-
-
SPUR
LLM/RM=GPT-4.1
2025.10
0
-
-
-
Feedback
Search any
task
Search any
task