AI软件测试范式转变:从断言到评估的完整指南

AI测试已从辅助工具演进为主导范式,核心是从"断言"转向"评分"的评估体系重构。
本文系统梳理了AI时代测试工作的三重体系:用AI测试、和AI测试、对AI测试,并指出行业头部已进入AI主导阶段。传统断言机制因大模型输出的概率性特征而失效,取而代之的是基于打分机制的"评估"范式。文章提出AI评估的两大核心原则:一是必须固定"被测系统版本"与"评估体系版本"两个维度,横向对比才有意义;二是评估对象分为大语言模型、知识库(RAG)、智能体三个递进层次,不同对象对应不同指标体系。工具层面推荐Promptfoo,因其CLI驱动架构可实现"AI评估AI"并天然支持版本化管理。作者强调,方法论的理解优先于工具操作,掌握范式转变、双版本固定、三层对象递进这三个核心框架,是在AI测试领域站稳脚跟的关键。
AI测试的三重体系:从辅助到主导
随着腾讯、阿里、字节以及DeepSeek等AI领先公司的持续投入,AI在测试领域的落地已从概念走向实践。本文基于行业实战经验,梳理AI时代测试工作的三种核心体系,以及从"测试"到"评估"的关键范式转变。
当前AI测试体系可分为三种模式:
- 用AI测试:借助AI工具辅助测试、提升效率(已逐渐成为基础能力)
- 和AI测试:人与AI各司其职,AI主导大部分测试工作
- 对AI测试:对内置AI功能的软件系统进行专项测试
说个细节,行业头部公司已进入"AI主导测试"阶段——需求分析、用例设计、系统探索、代码编写、自动化回归等核心环节均可交给AI完成。



为什么传统断言不再适用
确定性与概率性的根本差异
传统软件测试的核心是断言机制:结果非对即错,非通过即失败。比如接口测试中断言状态码、断言返回字段——这些输出都是确定的、稳定的、可预测的。
但在AI大模型领域,这套逻辑彻底失效。原因有二:
从技术原理看,主流生成式大模型基于Transformer架构,输出时存在概率选择机制。同一问题可能产生不同回答,这是模型的天然特性。
从结果表现看,即便是确定的结果也有多样表现形式。比如数字"2"可以是中文"贰"、"二",英文"two",阿拉伯数字"2",以及不同进制表示。模型参数、提示词的任何微调都可能导致输出变化。
因此,对AI的评估不是判断"对或错",而是通过打分机制表达"有多好"或"有多差"。这正如高考通过分数体现差距,是应对复杂场景的合理方案。
评估与测试的关系
AI评估并非完全抛弃测试。评估解决"打分"问题,测试环节则为分数划定及格线。就像高考有录取分数线、医学筛查有阈值,AI产品同样需要明确结论:系统能否上线、可否发布,最终依据评估分数的及格线判定。
打分与断言可以相互转化。AI领域常采用0到1的连续值打分(如0.1、0.9、0.999),但也可用0和1两个离散值表示传统的"不通过"与"满分"。
AI评估的核心要求:双版本固定
AI评估比传统测试更强调版本管理,且需固定两个维度:
被测系统版本
被测版本不仅是软件版本号,还包括:
- 使用的模型类型(如GPT-4、DeepSeek等)
- 模型的参数配置(温度、top_p等)
- 采用的提示词策略
- 添加的上下文信息
任何一项改变都构成版本差异。比如测试对象从DeepSeek切换到GPT,版本即不再一致,需重新评估。
评估体系版本
这是AI评估的独特维度——"谁测的、怎么测的"也需版本化:
- 使用的测试数据集
- 采用的评估标准
- 设定的阈值门槛
只有固定这两个版本,横向对比才有意义。若仅替换其中一个(如相同测试方法评估不同模型),可对比模型质量;若两个版本同时变化,结果失去对比价值。
类比理解:AI评估与性能测试高度相似。性能测试同样不关心简单对错,而是在特定条件下通过数据集发现问题,需要多轮对比才能得出结论。
AI评估的三层对象
很多人误以为AI评估就是堆砌指标(准确率、召回率等),但首先要明确评估对象,因为不同对象的评估目的和指标完全不同。
常见评估对象分为三种,且呈递进关系:
1. 大语言模型(LLM)
评估大模型生成内容的正确性、完整性、安全性和稳定性。适用场景:
- 模型选型:对比不同模型的性能、速度、能力
- 提示词优化:验证提示词改进效果
- 微调模型评估:如对千问系列小模型的本地微调效果验证
2. 知识库(RAG)
知识库先检索相关资料,再结合资料生成回答。评估重点:
- 检索准确性
- 召回率表现
- 忠诚度(生成结果是否有对应参考资料支撑)
- 各环节的协同效果
3. 智能体(Agent)
智能体是复杂度最高的评估对象,包含:
- 任务规划能力
- 工具选择策略
- 任务编排逻辑
- 知识库调用
- 底层大模型能力
客服Agent、数据Agent、旅游/法律/医疗Agent等应用将越来越普及。
学习路径建议:这三者不是单选题,而是递进学习脉络——先掌握大模型评估 → 再到知识库 → 最后到智能体。
工具选型:Promptfoo的优势
有了方法论,还需配套工具。Promptfoo 是当前值得推荐的主力工具:
核心优势
- CLI驱动架构:命令行和YAML驱动意味着工具本身可被AI调用,催生"AI评估AI"的潜力场景
- 支持人工评估金标准:通过YAML编写用例断言,实现零代码封装
- 强大扩展性:支持批量调用、Python自定义
- 行业认可:已被OpenAI收购,优秀性获头部AI公司背书
差异化选型建议
- 学术研究与模型开发:可选专注指标数据的专业工具
- 生产环境监控:面向用户的智能体适合使用生产追踪类工具
- 验收型测试(大部分测试场景):Promptfoo最合适,可覆盖大模型、知识库、智能体三层评估
方法论比工具操作更重要
工具操作、实战演示固然重要,但都建立在方法论之上。当你面对方向性困惑时,回顾以下核心框架会更有帮助:
- 从断言到评估的范式转变
- 双版本固定原则
- 三层评估对象的递进关系
理解这些本质,才能在AI测试这一新兴领域站稳脚跟,应对快速变化的技术环境。
相关推荐

@ai-sdk/zai@3.0.10 发布:依赖更新的补丁版本解析
Vercel AI SDK 发布 @ai-sdk/zai@3.0.10 补丁版本,同步更新 provider、provider-utils 与 openai-compatible 等底层依赖。本文解析该版本变更内容及 AI SDK provider 体系的设计意义。

Vercel AI SDK 更新:@ai-sdk/workflow 2.0.29 修复工具结果保留问题
Vercel AI SDK 发布 @ai-sdk/workflow 2.0.29 补丁版本,核心修复工作流在终止、延迟、暂停三种响应状态下 provider 工具执行结果的保留问题,并同步升级 ai@7.0.98 等核心依赖。

Vercel AI SDK 更新:@ai-sdk/xai 4.0.58 批处理与图像生成改进
Vercel AI SDK 发布 @ai-sdk/xai 4.0.58 版本更新,新增批处理图像生成支持,修复批处理请求类型校验及 DeepSeek 推理流问题,并同步升级 provider 相关依赖。