同时让四五个编码 Agent 干活,像让一个小团队共用两台工作站:关键不只是某次回答有多快,而是所有任务合起来能产出多少。Reddit 用户 swiebertjee 报告称,在双台 DGX Spark——NVIDIA 的桌面 AI 计算系统——上更新推理配方后,GLM-5.3 Flash 的 decode(逐个 token 生成回答)性能提升 50%—90%,因而从 DeepSeek v4.0 Flash 转向该模型。
细测结果更复杂,也更值得看。不同任务的单路 decode 提升约 3%—13%;32K 上下文时从 41.1 增至 44.2 tokens/s,128K 时反而下降 5%。Prefill——模型先读入提示词的阶段——则慢了 10%—21%。多路并发的合计吞吐也有升有降:两路提升 13%,四路和六路分别下降 7% 和 2%。这说明“逾五成”不能直接理解为每位用户都快一半;它更像一份面向双机、多 Agent 场景的实测线索。以上性能与质量判断均来自作者自测,摘要未披露完整配方及独立复现结果。