一台2018年的旧服务器,还能不能当本地AI节点?开发者okoyl3把Strata——让系统内存与GPU显存协同运行大模型的推理软件——移植到IBM AC922。这套机器使用POWER9处理器和4块16GB NVIDIA Tesla V100 GPU,架构不同于普通PC,软件需要专门适配。
运行Qwen3.8-FN量化模型时,作者称提示词预填充——模型先读完输入的阶段——峰值约7350 tok/s;解码——逐个生成新词元——峰值约113 tok/s,而此前llama.cpp在同机上的解码约为15 tok/s。关键改动包括内存管理、把部分专家参数缓存到GPU,以及更充分利用NVLink高速互连。作者还报告,处理25.2万词元输入后,首个新词元等待0.26秒。不过这些数字目前来自开发者自测,摘要未披露统一对照条件或独立复现结果。