Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Long-context retrieval and reasoning on RULER (test)
Loading...
92.72
Retrieval (EM)
Llama 3.1 8B Instruct
2.6768
26.0534
49.43
72.8066
Nov 5, 2025
Retrieval (EM)
MH Tracing (EM)
Aggregation (EM)
QA (F1)
Updated 3mo ago
Evaluation Results
Method
Method
Links
Retrieval (EM)
MH Tracing (EM)
Aggregation (EM)
QA (F1)
Llama 3.1 8B Instruct
Base Model=Llama 3.1 8...
2025.11
92.72
68.08
36.07
59.13
SnapStream
Base Model=Llama 3.1 8...
2025.11
87.38
68.48
27.74
59.68
SAGE-KV
Base Model=Llama 3.1 8...
2025.11
60.43
65.24
24.92
58.78
StreamingLLM
Base Model=Llama 3.1 8...
2025.11
6.14
3.64
37.42
45.82
Feedback
Search any
task
Search any
task