Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Knowledge Editing on Temporal τ=75 GPT-J-6B (OOD)
Loading...
98
Reliability
WISE
-1.84
24.08
50
75.92
Jun 18, 2026
Reliability
OOD Generalization
Locality
Average Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
Reliability
OOD Generalization
Locality
Average Score
WISE
Base Model=GPT-J-6B
2026.06
98
38
99
78
LOKI
Base Model=GPT-J-6B
2026.06
98
36
81
72
FT
Base Model=GPT-J-6B
2026.06
93
32
62
62
AlphaEdit
Base Model=GPT-J-6B
2026.06
87
28
97
71
w/o Editing
Base Model=GPT-J-6B
2026.06
56
21
-
-
GRACE
Base Model=GPT-J-6B
2026.06
56
22
100
59
DEFER
Base Model=GPT-J-6B
2026.06
55
21
95
57
MEMIT
Base Model=GPT-J-6B
2026.06
43
14
49
35
ROME
Base Model=GPT-J-6B
2026.06
2
0
2
1
Feedback
Search any
task
Search any
task