Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.071 — 2026-09-13
NEWS 约 4 分钟

Claude插件有了可复现考试

Claude Code给插件加上标准化“考试”:能评分、复跑,还能输出机器和人都方便查看的报告。

IMAGE — Claude Code Releases

你改完一个插件,现场试了几次,看起来都能用。但它是真的稳定,还是刚好这几次没出错?插件——给宿主程序增加命令、工具或工作流程的扩展包——过去常靠作者手动演示验收。Claude Code v2.1.269 新增的 claude plugin eval,试图把这件事变成一场可以反复举行的“考试”。

需要先说明:目前核心信息只来自 Claude Code 官方发布说明,尚无第三方系统复测。Anthropic 所说的“可复现”,仍是官方描述,不等于已经证明每次运行都会得到完全相同的分数。

插件终于有了一张固定试卷

新命令可以运行插件的 eval suite。eval suite 即“评测套件”:把一组固定输入、预期行为和评分规则放在一起,反复检查不同版本。说白了,它像一张标准化试卷。插件升级前考一次,升级后再考一次,作者便有机会发现原本能用的功能是否退步。这类反复检查也叫回归测试。

命令会给结果评分,并生成 JSON 和 HTML 两种报告。JSON 是方便程序读写的结构化文本,可接入持续集成——也就是每次提交代码后自动运行的检查流程——还可用于统计分数或设置质量门槛。HTML 则是网页形式的报告,适合直接查看。两种输出解决的是同一件事:评测不再只停留在终端里的一次演示,而能留下便于比较和处理的记录。

分数能看出“会做”与“照规矩做”的差别

BuildWithClaude 社区一则开发者实测帖提供了一个直观例子。作者先让测试全部通过,再故意制造配置漂移,也就是让实际配置逐渐偏离原先约定。最终总分从 1.00 降至 0.36,其中检查 Skill 是否触发的哨兵用例降到 0.00。

但内容类用例没有全部归零:Claude 仍能写出像样的 Java,只是不再遵循团队约定。这个区别很重要。人工扫一眼结果,可能只会觉得“代码还能写”;固定评测却能追问另一层:插件本应施加的规则和流程,是否真的还在生效。

原生能力出现前,社区已经在探索类似做法。2026 年初,独立开发者 sjnims 曾在 Reddit 征集插件,用一套借鉴 Anthropic 开源评测工具 Bloom 的流程,检查 Skill 触发、代码可运行性和回答准确性,并称完整检查约需两分钟。现有材料不足以证明官方命令由这项实验演变而来,但它说明插件作者对自动验收已有现实需求。

为什么值得关注

这次更新的意义,不在于多了一个报告格式,而在于 Claude Code 给插件生态提供了统一的评测入口。作者可以用同一条命令运行测试、获得分数并保存结果。插件验收因此有机会从“给你演示一下”转向“把试卷、成绩和报告交出来”。

如果这种入口被广泛采用,插件升级是否退步、团队约定是否仍被执行,就更容易纳入日常开发流程。不过,JSON 和 HTML 只是结果载体,并不代表评分方法已经公开,更不代表结果经过独立验证。

局限与未知

  • 发布说明没有交代评分标准、评测环境如何固定,也没有展示样例报告。
  • 材料未说明模型版本、采样参数、重复运行方差及跨机器一致性。
  • 因此,“可复现”目前应理解为 Anthropic 对设计目标的描述,而不是“考试结果完全一致”的已验证结论。

供稿材料 SOURCES — 1
01
v2.1.269 Claude Code Releases · NEWS
原文 ↗

← 返回 2026-09-13 · 开源板块