让 AI 读一份几十万字的材料,真正费算力的不只回答,而是开口前先把全文读一遍。这一步叫预填充(Prefill)。其中,注意力机制要判断每个词该参考哪些词;输入长度翻倍,标准做法比较的词对约增至四倍。CRISP 瞄准的正是这段成本:不再给所有输入套同一种省算模板,而是按当前输入的注意力结构,动态决定哪些位置值得计算。
它最具体的改动,是直接查看注意力是否集中在“开头锚点”和“最近内容”等结构位置,据此选择稀疏计算路径,省去旧方案为路由额外做的一轮矩阵计算与差异度量。论文报告,这种判断与旧方案 JSD 路由在 Llama-3.1-8B、Qwen2.5-7B 上分别有 94.0% 和 88.1% 的一致率。作者还称,CRISP 会避开累计阈值把微弱背景噪声也选进来的问题,并在 512k tokens 时实现最高 5.30 倍注意力加速;这些效果目前以论文自述为准。