Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Knowledge Editing on Temporal τ=10 GPT-J-6B (OOD)
Loading...
100
Reliability
LOKI
6.4
30.7
55
79.3
Jun 18, 2026
Reliability
OOD Generalization
Locality
Average Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
Reliability
OOD Generalization
Locality
Average Score
LOKI
Base Model=GPT-J-6B
2026.06
100
36
82
73
WISE
Base Model=GPT-J-6B
2026.06
99
36
93
76
FT
Base Model=GPT-J-6B
2026.06
96
35
69
67
AlphaEdit
Base Model=GPT-J-6B
2026.06
90
27
99
72
MEMIT
Base Model=GPT-J-6B
2026.06
82
28
99
70
DEFER
Base Model=GPT-J-6B
2026.06
66
29
81
59
GRACE
Base Model=GPT-J-6B
2026.06
59
22
100
60
w/o Editing
Base Model=GPT-J-6B
2026.06
56
21
-
-
ROME
Base Model=GPT-J-6B
2026.06
10
0
6
5
Feedback
Search any
task
Search any
task