你让两个Agent处理同一份任务,即使它们使用同一个模型,结果也可能不同:一个会在工具报错后重试,另一个可能原地卡住。差别来自Agent runtime,也叫harness——包在模型外面的执行框架,负责规划循环、整理上下文、调用工具、重试和保存状态。两则LocalLLaMA讨论认为,只看模型跑分,已经不足以解释Agent为何成功或失败。
用户Balance-提出,应把不同平台放进同一套端到端基准:让系统完整执行真实任务,再比较成功率、每次成功的成本、耗时、工具调用与重试次数、长任务可靠性,以及是否需要人工介入。关键是做可控变量实验:固定模型只换harness,再固定harness只换模型,才能看清差距究竟来自哪一层。
另一位用户Background-Job-862进一步主张同时开放模型与harness,以便调整上下文、工具执行、停止条件和状态维护。这些仍是社区提议,材料未给出已落地的统一基准或实测结果;但问题很明确:今后要比较的,不只是AI的“大脑”,还有它把事情做完的整套工作机制。