Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
PAPER H 30 约 1 分钟

手机LLM开始管理多任务记忆

mzCache让手机AI边恢复内存边工作,减少应用切换后的等待

你刚用手机 AI 聊完一件事,转去拍照或玩游戏,再切回来,它可能要等很久才开口。原因是其他应用挤占内存后,系统会赶走模型权重——模型学到的规则——以及 KV cache(保存对话中间计算结果的“速记”)。mzCache要解决的,就是手机多任务环境下这段恢复等待。

它最巧的一步,是优先移走模型靠后的层,保留计算时最先用到的前层。这样请求到来后,GPU 可以立刻从前层开始推理,CPU 同时按计算顺序恢复后层;系统还把缓存细分,只移走释放内存所需的部分,并结合压缩内存与存储两条恢复路径。论文称,手机端模型及缓存合计可占 5–7 GB,切换应用后的首字等待可从 0.8 秒升至 16 秒;其 Android 原型基于 llama.cpp,相比存储支持的部分卸载方案,将首字响应加快 2.1–5.5 倍。


供稿材料 SOURCES — 1
01
mzCache: On-Device LLM Memory Management under Multitasking arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-05 · 学术板块