让 AI Agent 连续工作很久,像让人把不断变厚的会议记录全摊在桌上:每写一句,都要翻旧页,还得留着大量草稿。稀疏注意力只查看部分重要历史,理论上更省资源;但不同方法保存和整理“草稿”的方式不同,现有推理引擎很难统一高效执行。SparseEngine要补的正是这层工程缺口。
它没有强迫所有方法使用同一种缓存格式,而是规定一套共同的运行“生命周期”:方法自行管理 KV 缓存——模型为避免重复计算而保存的历史中间结果——引擎则统一负责调度与状态切换。系统因此接入了四类共15种方法。其 Chain Cache还能把删减后的缓存及相关状态留到下一轮对话继续用,避免Agent每轮重新处理整段历史;可控的前缀缓存裁剪则能删除指定历史区间,同时保留前缀匹配。
作者称,在保持所测方法任务质量的前提下,SparseEngine借助物理删除KV,在大批量场景取得超过10倍解码吞吐;相同并发量下比vLLM快逾2.5倍,并在多轮Agent基准上实现超过2倍的端到端加速。这些效果目前以论文实验为据。