AI 编程 › AI 资讯 › 正文

TempoKV: Timely Staging of LLM KV Caches for Memory-Semantic Flash

arxiv · arXiv · 2026-09-28 20:55 · 评分 84

提出TempoKV,一种面向内存语义闪存的时序感知资源提交层,通过合理安排可复用KV缓存的暂存时机,降低LLM服务中前缀缓存的SSD延迟并优化快速层容量。

原文:arXiv | 返回 AI 资讯列表