Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
LLM Inference Efficiency on Uniform Sampled Documents
Loading...
191.7
TTFT (ms)
Lazy-Attn
33.348
1,102.224
2,171.1
3,239.976
Jun 3, 2026
TTFT (ms)
Speedup (vs Prefix)
Updated 1mo ago
Evaluation Results
Method
Method
Links
TTFT (ms)
Speedup (vs Prefix)
Lazy-Attn
Hardware=H100 (High BW)
2026.06
191.7
6.2
CacheBlend
Hardware=H100 (High BW)
2026.06
274.8
4.3
Lazy-Attn
Hardware=A100 (Mid BW)
2026.06
372.5
6.9
CacheBlend
Hardware=A100 (Mid BW)
2026.06
565.3
4.5
Lazy-Attn
Hardware=A40 (Low BW)
2026.06
675.2
6.1
CacheBlend
Hardware=A40 (Low BW)
2026.06
1,150.6
3.6
Prefix Caching
Hardware=H100 (High BW)
2026.06
1,196.8
1
Prefix Caching
Hardware=A100 (Mid BW)
2026.06
2,580.4
1
Prefix Caching
Hardware=A40 (Low BW)
2026.06
4,150.5
1
Feedback
Search any
task
Search any
task