本地跑多模态模型时,主显卡既要负责“想和写”,又要腾空间“看图”,显存很容易吃紧。一个简单思路是:让闲置的低显存旧卡专门处理视觉部分,像给主力请一位只负责看材料的助手。这样尤其适合多模态 Agent——能看图并连续执行任务的 AI 程序,视觉处理太慢会拖累每轮响应。
据 llama.cpp 官方文档,多模态推理通常需要主体语言模型和 mmproj——负责把图片编码、转换成语言模型可理解表示的独立组件。Reddit r/LocalLLaMA 的一则社区实测建议,用 --mmdev CUDA1 把 mmproj 指定给第二张 GPU,而不是通过 --no-mmproj-offload 留在 CPU。发帖者称,前者比 CPU 方案快一个数量级,同时不影响主体模型的生成速度;它也能把视觉组件占用的 VRAM——显卡上的高速内存——从主卡挪走。
这更像一条值得试验的配置技巧,而非完整基准结论:帖子没有披露硬件配置或测试表。官方也提醒,llama.cpp 的多模态支持仍在快速开发,相关接口可能发生不兼容变化。