在 Windows 上跑本地模型时,如果你切到别的窗口,回答突然慢下来,先别急着怀疑显卡。Reddit 用户 koloved 实测称,一个约 27B 参数的 NVFP4 模型通过 ninfer 运行时,终端获得焦点可达 130–200 tok/s;终端失去焦点后,只剩 50–60 tok/s。tok/s 是模型每秒生成的 token 数,数值越高,文字通常出现得越快。
反直觉的是,慢速运行时 GPU 时钟反而更高,功耗上限也没变;真正拉长的是 CPU 一侧的等待时间,从 16–17 毫秒增至 38–41 毫秒。作者把服务改为无头运行——让它脱离需要交互的控制台窗口、独立留在后台——速度便稳定回到 130–200 tok/s,不再随窗口焦点变化。作者还称原生 Windows 版本也能复现,因此并非 WSL2 独有。这个案例尚非系统性测试,但很适合作为排障提醒:Windows 本地推理变慢时,除了 GPU、内存和驱动,也要检查宿主窗口是否在拖慢服务循环。