买车时看到的是赛道成绩,真正能提走的却是另一个配置。Meta 新发布的 Muse Spark 1.3 也有类似落差:它宣称在编程和 Agent(能调用工具、分步骤完成任务的 AI)上达到前沿水平,但用于主要性能比较的是计算预算最高的“max”推理档。
据 VentureBeat 报道,开发者目前普遍能调用的最高档只有“xhigh”。推理档位越高,模型通常能花更多时间和算力作答,因此两个档位的成绩不能直接当成同一种使用体验。xhigh 相比 1.2 在两项工具使用测试中有所提升,却在长文档和知识测试上退步。
问题不在于成绩一定不可信,而在于最亮眼的版本尚难被广泛验证和采用。Meta 还没有公布 max 档的开放时间或价格,所以现阶段所谓“前沿水平”,不能直接等同于开发者现在可以买到的能力。