Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
User-Agent Dialogue Evaluation on TRACE Overall (test)
Loading...
82
Accuracy
RM
66.4
70.45
74.5
78.55
Oct 22, 2025
Accuracy
F1 Score
Precision
Recall
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
F1 Score
Precision
Recall
RM
LLM/RM=Skywork
2025.10
82
75
71
82
SCOPE
LLM/RM=Sonnet-3.5
2025.10
79
76
61
98
SCOPE
LLM/RM=GPT-4.1
2025.10
79
76
62
99
G-Eval
LLM/RM=Sonnet-3.5
2025.10
77
74
59
100
G-Eval
LLM/RM=GPT-4.1
2025.10
76
73
58
100
SPUR
LLM/RM=Sonnet-3.5
2025.10
69
68
51
100
SPUR
LLM/RM=GPT-4.1
2025.10
67
67
50
100
Feedback
Search any
task
Search any
task