不用英伟达独立显卡,也想在自己的电脑上跑大模型,难点往往不只是硬件够不够,还在于软件能否把硬件真正调动起来。作者 ilintar 针对 AMD Strix——把 CPU 与集成 GPU 等单元放进同一芯片体系的平台——整理了一套 Qwen3.8 27B 本地推理配置。它建立在 llama.cpp 之上;后者是让大语言模型在消费级硬件上运行的开源工具。
这份配方最有价值的地方,是把当前几个实际卡点串成了一条可操作路径。作者称,主流 llama.cpp 的 ROCm 支持眼下受统一内存访问问题影响,因此另建了 strix-halo 分支,合并环形缓冲区修复、TOP-K 优化与主分支代码;针对 ROCm 图更新过慢的问题,还需要暂时使用自行编译的动态库。作者也修改了 ROCm HIP 库,让 HIP 图采用更底层的 PM4 调度,并称这能让受调度限制的模型解码提速 20%。不过,Qwen3.8 27B 在 Strix 上主要受内存带宽限制,不能直接套用这一增幅。
这更像一张当下可用的维修路线图,而不是稳定的通用方案。作者明确提醒,它是拼接出的阶段性配置,相关修复仍在等待进入上游,后续分支也需要持续维护。