想在Mac上跑本地大模型,麻烦往往不只在“跑起来”,还在于怎么接进现有聊天应用或Agent。TensorFold把底层计算藏在服务后面:它用MLX——Apple为Apple Silicon优化的机器学习框架——执行模型推理,再提供OpenAI兼容API。换句话说,客户端通常只需更换服务器地址和模型名,不必重写整套接入逻辑。
项目同时把加速做到不同模型家族内部:每一家族配有自己的计算内核和草稿验证。后者会先快速提出一批候选token——模型生成文字时逐个吐出的基本单位——再交给主模型成批确认,以减少生成等待。当前列出的支持范围覆盖Nemotron、Qwen、GLM、Gemma和DeepSeek等模型,并兼顾Apple Silicon与NVIDIA GPU;部分量化格式和CUDA路径仍标为实验性或等待硬件验证。值得关注的不是又一个模型,而是它试图把本地推理做成现有软件可直接调用的基础服务;不过项目材料未提供统一的速度或精度测试,实际表现仍需按设备和模型判断。