想在家里运行超大模型,第一道门槛往往不是算力,而是“装不下”:模型越大,占用的 VRAM(显存,GPU 直接使用的高速内存)越多。Reddit 用户 segmond 称,他用 12 张 CMP 170HX 拼出一套 768GB 显存设备,总成本低于一张 RTX 6000 Pro。CMP 170HX 原本是 NVIDIA 面向加密货币挖矿推出的计算卡,这类方案依赖大量二手硬件,更像动手实验,而非即插即用的整机。
作者称,这套设备可通过 vLLM 或 llama.cpp 运行 GLM5.3、Qwen3.8-2.4T、KimiK3 等模型,还能用光纤连接另一套机器,通过 RPC(让远端机器参与计算的调用方式)继续扩展内存。它的价值在于展示了一条另类路线:用速度、功耗和工程复杂度,换取罕见的大显存容量。不过帖子没有给出实测生成速度、功耗、购置明细和稳定性数据;多张卡的容量虽能相加,卡间通信仍可能成为瓶颈,因此“能装下”不等于“跑得快”。