Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Who & When

Benchmarks

Task NameDataset NameSOTA ResultTrend
Error AttributionWho&When
Pair µF18.1
30
Failure AttributionWho&When
Agent Accuracy60.79
22
Error RecognitionWHO&WHEN Algorithm-Generated
Accuracy@038.9
19
Error RecognitionWHO&WHEN Human-Crafted
Acc@017.2
19
Fault attributionWho&When Hand (58 traces)
Top Accuracy31
16
Fault attributionWho&When Algo (126 traces)
Accuracy49.2
16
Failure AttributionWho&When (HC)
Accuracy (%)22.99
15
Failure AttributionWho&When (Alg)
Accuracy (Who&When Alg)42.86
15
Trajectory AttributionWho&When n=58 (Hand-Crafted)
Agent-level Accuracy73
15
Trajectory AttributionWho&When Algorithm-Generated n=126
Agent-level Accuracy68
15
Failure AttributionWho&When Total
Step-level Accuracy36.22
13
Failure AttributionWho&When Hand-Crafted
Step-level Accuracy41.38
13
Failure AttributionWho&When Algorithm-Generated
Step-level Accuracy42.86
13
Online auditingWho&When
Step Accuracy57.69
8
Error ForecastingWho&When
Eta (%)100
6
Failure attributionWho & When Boundary
Agent Attribution Accuracy38.71
6
Failure attributionWho & When Remove ID
Agent Attribution Accuracy26.47
6
Failure attributionWho & When Baseline
Agent Attribution Accuracy54.33
6
Step-level fault attributionWho&When HC
Top-1 Accuracy21.26
5
Step-level fault attributionWho&When (Alg)
Top-1 Accuracy28.84
5
Step-level attributionWho&When attribution benchmark
Rec-Exact60
4
Step-level failure attributionWho&When HC
Input Tokens79,817.71
4
Step-level failure attributionWho&When (Alg)
Input Tokens15,673.79
4
Fault localizationWho&When
Top-1 Accuracy21.1
3
Showing 24 of 24 rows