想让编码 Agent 用 Mac 上的本地模型,麻烦往往不在“模型能不能回答”,而在“现有工具能不能顺利接上”。Rapid-MLX 是一个面向 Apple Silicon 的开源推理服务器:它用 MLX——Apple 为自家芯片打造的机器学习框架——加载模型,再提供兼容 OpenAI 与 Anthropic 的 API。换句话说,原本连接云端模型的工具,通常只需更换地址和配置,就能调用本地后端。
它尤其瞄准编码 Agent 的工具调用:模型必须按规定格式写出工具名称和参数,否则即使回答得不错,也无法稳定编辑文件或运行命令。项目为此提供了 27 个工具调用解析模块,并带自动识别后备方案。作者还报告,在 M4 Pro Mac mini 上运行同一份 Qwen3.5-9B 4-bit 模型时,18 项流式任务的解码速度中位数是 mlx-lm 的 1.50 倍;一次整文件代码编辑达到 4.27 倍。不过,长提示词任务的端到端速度只快 1.05 倍,说明“最高 4 倍”并非普遍表现。