ChunkLLM:A Lightweight Pluggable Framework for Accelerating LLMs Inference
(arxiv 2025)2510.02361 ChunkLLM 不仅在短文本基准上达到与基线相当的性能,同时在长上下文基准上仍保持 98.64% 的性能,并维持48.58% 的关键值缓存保留率。特别地,在处理 120K 长文本时,ChunkLLM相较于原始 Transformer 实现了最高达 4.48× 的加速比。 现有方法的局限性: 线性注意力(Linear Attention)(如Mamb