Infill KV Caching
-
Last Updated 28 April, 2026
-
by David Spuler, Ph.D.
Research on Infill KV Caching
Research papers include:
- Tianyu Guo, Hande Dong, Yichong Leng, Feng Liu, Cheater Lin, Nong Xiao, Xianwei Zhang, 29 May 2025 (v2), EFIM: Efficient Serving of LLMs for Infilling Tasks with Improved KV Cache Reuse, https://arxiv.org/abs/2505.21889 https://github.com/gty111/EFIM
- Tianyu Guo, Tianming Xu, Xianjie Chen, Junru Chen, Nong Xiao, Xianwei Zhang, 29 Sep 2025, RServe: Overlapping Encoding and Prefill for Efficient LMM Inference, https://arxiv.org/abs/2509.24381
- Saehun Chun, Sera Choi, Wonje Choi, Sanghyun Ahn, Honguk Woo 11 Feb 2026 (updated), Ca^2P: Cache-Augmented Code-as-Policies for Open-Domain Embodied Tasks, Submitted to ICLR 2026, https://openreview.net/forum?id=bZcOscOMlx https://openreview.net/pdf?id=bZcOscOMlx
More AI Research Topics
Read more about:
- 500+ LLM Inference Optimization Techniques
- What's Hot in LLM Inference Optimization in 2025?
- Inference Optimization Research
- « Research Home