[控场AI]
产品插件评估

Plugin Evals

Claude Code内置的插件评估功能,支持基线对比、JSON与HTML格式评估报告及CI门禁机制,将Agent扩展插件从主观调试转变为可量化、可测试的工程基础设施

时间轴 (近 90 天)

9月14日

Claude Code 2.1.269 版本新增了 Plugin Evals(插件评估)功能

待验证50%
9月14日

Plugin Evals 引入了基线对比(baseline comparisons)机制

待验证50%
9月14日

Plugin Evals 提供 JSON 和 HTML 两种格式的评估报告

待验证50%
9月14日

Plugin Evals 引入了 CI 门禁(CI gates)机制

待验证50%
9月14日

CI 门禁允许团队在持续集成流程中设置评估阈值,只有当插件评估分数达到标准时代码才能通过

待验证50%
9月14日

JSON 报告是机器可读的,便于集成到自动化流水线或被脚本解析

待验证50%
9月14日

HTML 报告面向人类阅读,直观呈现评估结果

待验证50%
9月14日

通过引入评分基线,Plugin Evals 将概率性输出转化为可比较的量化指标,使 CI 集成在技术上成为可能

待验证50%
9月14日

基线对比功能使开发者可以把插件当前表现与此前版本进行量化比较

待验证50%

全部知识事实 (9)

来源文章