AI测试的三层评估体系:大模型、知识库与智能体

AI时代软件测试需从断言转向评估,构建三层递进的AI评估体系。
文章系统阐述了AI时代测试体系的变革:从"用AI测试"到"和AI测试"再到"对AI测试"三大范式。由于大模型输出的概率性,传统断言式测试不再适用,需引入"评估"(打分制)替代二元判定,同时通过划定及格线完成最终测试决策。评估对象分为大模型、知识库(RAG)、智能体三层递进体系,并推荐Promptfoo作为评估工具。
AI时代测试体系的三大范式
半年前谈及AI与软件测试的结合,行业还停留在"AI辅助测试"的懵懂阶段。而如今,随着腾讯、阿里、字节乃至DeepSeek等头部企业在工程化层面的持续发力,AI测试领域的落地路径已经愈发清晰。
根据B站相关技术分享的观点,AI时代下的测试体系可以归纳为三种:
- 用AI测试:借助AI进行辅助测试,提升效率。这曾是半年前的热门话题,但如今已基本成为"过去式"。
- 和AI测试:人与AI各司其职。人不再是唯一主导者,需求分析、用例设计、系统探索、代码编写、自动化回归等大部分工作都可以交给AI完成——这就是当下头部厂商推动的"AI主导测试"。
- 对AI测试:一个全新方向——不再讨论人与AI的分工,而是关注那些内部集成了AI能力的软件系统本身如何被测试。
第三种体系正在快速崛起。中国移动、中国电信的AI客服,各类AI占卜、AI视频生成应用……越来越多的产品内部搭载了AI功能。这类AI应用测试的思路、流程与传统软件测试截然不同,构成了一个独立且重要的命题。
为什么"测试"要变成"评估"
对AI进行测试,与传统软件测试有本质差异。传统测试依赖断言(assertion)——结果非对即错、非通过即失败,没有第三种可能。比如接口测试中,我们可以断言状态码、断言返回字段的具体内容,这些输出都是确定的、稳定可靠的。

但AI大模型打破了这种确定性。它的输出是概率性的,这来自两个层面的客观因素:
原理层面:Transformer的天然概率性
当前主流的生成式大模型大多基于Transformer架构,而Transformer在输出token时本质上就是一个概率选择的过程。因此,大模型天生自带概率性——同一个问题可能得到不同回答,这是其架构中固有的特征。
结果层面:输出表达的多样性
即便一个结果是确定的(比如输出数字"2"),它的表现形式也千变万化:中文大写"贰"、小写"二"、英文"two"、阿拉伯数字、二进制、十六进制,甚至风格上的差异。更不用说模型参数、提示词、上下文的任何微小改动,都会导致结果的巨大变化。
这意味着:对一个正确场景,简单的相等断言或许成立;但对错误场景,可能存在几千万种"不相等"的表现。用断言方式判定AI输出,显然不再合适。
于是,我们引入了一个新术语——评估(evaluation)。这并非国内独创,而是中外学界对人工智能测试一直沿用的国际惯例。正如我们判断一个人不能简单地说"好人"或"坏人",判断疾病也是通过评分而非二元结论。对模仿人类的AI,同样应采用打分、评估的方式。
评估不等于抛弃测试
需要澄清一个常见误区:AI评估并不完全取代传统测试。

评估的核心是打分——用连续的分数(通常是0到1的连续值)表达结果"有多好、有多差"。但AI产品最终要给出一个明确结论:这个软件能否上线、能否发布?这就需要测试环节为分数划定及格线,如同高考的录取分数线、医疗诊断的判定阈值。
有趣的是,评估与测试可以相互转化。在AI领域打分一般用0到1的连续值,但也可以简化为0和1两个固定值:0表示不通过,1表示通过——这就退化为了传统的断言式测试。因此在实际项目中,既可能遇到连续分值,也可能遇到二元判定,关键是理解二者的内在联系。
版本固定:AI评估的特殊要求
由于评估结果模糊且可能波动,AI测试对版本管理提出了更严格的要求——必须同时固定两个版本:
- 被测版本:不仅是软件版本号,还包括使用了什么模型、传入了什么参数、使用了什么提示词、添加了什么上下文。任何一项变化都意味着被测版本变化,比如从DeepSeek换成GPT,结果就必须重新评估。
- 评估版本:即用什么手段测试——数据集、断言规则、评分标准、及格门槛。数据集或门槛一旦改变,结果同样会不同。
只有固定其中一个版本、变动另一个,才具备横向对比价值(如对比不同模型质量、不同门槛效果)。若两者同时变化,则失去可比性,只能作为独立的全新评估结果解读。这一逻辑与性能测试高度相似——性能测试同样不单纯关心对错,而是通过一组数据、在特定条件下、通过对比来发现问题。
评估什么:三层递进的评估对象
很多人一上来就关心指标——忠诚度、召回率、并发率……但这是本末倒置。正确的做法是先确定评估对象,因为不同对象的目的和指标完全不同。

评估对象可分为三层,且呈递进关系:
第一层:大语言模型(LLM)评估
主要评估模型生成内容的正确性、完整性、安全性和稳定性。对DeepSeek这类模型厂商来说是核心工作;对普通公司而言,则用于以下场景:
- 模型选型:哪个模型更好、更快、更聪明
- 提示词优化:基于评估结果迭代,而非拍脑袋
- 微调模型验证:如今千问等开源小模型可在本地微调,很多公司有实际验证需求
第二层:知识库(RAG)评估
RAG知识库的原理是先检索资料,再结合资料回答用户问题。因此评估需要覆盖各个环节:
- 检索是否准确
- 召回是否完整
- 忠诚度如何——生成结果是否基于指定参考资料
召回率、忠诚度等指标正是为RAG评估场景而生。
第三层:智能体(Agent)评估
客服Agent、数据Agent,以及旅游、法律、医疗等垂直领域的Agent将越来越多。智能体评估最为复杂,因为它包含任务规划、工具选择、任务编排、知识库调用,最根本还要使用大模型。

这三层并非"三岔路口"让你选一条,而是知识度、复杂度递增的递进关系:先掌握大模型评估,再到知识库评估,最后是智能体评估。这也构成了一条清晰的AI测试学习路线。
工具选型:为什么推荐Promptfoo
最后一个关键问题是"用什么工具做AI评估"。在多款面向有代码基础的评估工具中,Promptfoo 值得重点关注,理由如下:
- CLI + YAML驱动:可以被AI自己调用,一个用来评估AI的工具本身又能被AI使用——这就孕育了"AI评估AI"的巨大潜力
- 人工评估支持:在AI仍非"权威"的当下,人工评估是金标准。通过YAML编写用例断言,实现零代码封装的评估流程
- 强扩展性:支持批量调用、Python自定义,发展前景广阔
- 被OpenAI收购:其优秀性获得顶级AI公司认可
当然工具选型应因场景而异:偏学术的模型指标研究、面向用户的线上智能体生产监控,各有更合适的工具。但对以"判定软件能否上线"为目的的大部分测试团队而言,Promptfoo兼具验收能力,且能覆盖大模型、知识库、智能体三层评估对象,是较为均衡的选择。
总结
从断言到评估,是测试工程师在AI时代必须完成的观念转变。理解"为什么评估、评估什么、用什么评估"这三个方向性问题,远比掌握某个工具的具体操作更重要。
当你在实际工作中面对AI测试方向上的迷茫时,记住这套三层递进的评估体系框架——从大模型到知识库再到智能体,由浅入深、逐层深入,这才是真正的价值所在。
相关推荐

GitHub开源项目贡献指南:找到值得参与的优质Issue
想参与开源但找不到合适项目?本文分享实用策略,包括GitHub高级搜索技巧、聚合工具推荐、活跃度判断方法,帮你高效找到值得贡献的开源Issue。

法官全程用AI判案仍享司法豁免?责任真空引发法律界深思
法院裁定法官完全依赖AI作出裁决仍受司法豁免权保护,引发法律界广泛争议。本文深度解析司法豁免权的边界、AI判案的责任真空问题,以及未来司法AI治理框架的可能方向。

Coze扣子实战:零代码搭建多Agent智能体全流程
详解Coze扣子智能体开发平台的核心能力与实战流程,涵盖Coze与Dify对比、Agent类型选择、工作流搭建、技能商店及多Agent协作模式,助你零代码快速构建AI智能体。