[控场AI]
· 8 分钟阅读· 4,246 字

AI大模型测试三阶段:从断言到评估的思维转变

AI大模型测试三阶段:从断言到评估的思维转变

AI测试体系从「断言对错」演进为「评估打分」,需固定双版本并按大模型、RAG、Agent三层递进评估。

随着AI深度嵌入软件产品,测试体系正经历三次演进:从用AI辅助测试、到人机协作测试、再到对AI功能本身进行测试。核心范式转变在于:大模型输出具有概率性,传统「对/错」二值断言不再适用,必须转向「评估」——用0到1的连续分数衡量结果质量,再通过设定门槛决定产品能否上线。AI评估还对版本管理提出更严格要求,需同时固定「被测版本」(模型、参数、提示词)和「评估版本」(数据集、断言、门槛),只有单一变量变化时横向对比才有意义。评估对象分三层递进:大模型评估关注正确性与安全性,知识库(RAG)评估重点看召回率与忠诚度,智能体评估则需覆盖任务规划、工具调用的完整执行轨迹,复杂度依次升级,构成清晰的学习路线。

AI时代下测试体系的三次演进

随着AI深度渗透软件开发流程,测试岗位正经历一场结构性变革。一位深耕测试开发领域的B站UP主(曾以Python为主,如今开始用JS写项目)分享了他对AI测试体系的最新观察:半年前还处于「懵懂意识」阶段的AI测试思路,如今已经越来越清晰、越来越明朗。

他将AI时代的测试体系归纳为三个层次:

  • 用AI测试:借助AI辅助测试、提高效率。这曾是半年前测试领域最热门的话题,但作者认为这一模式「已经成为过去式」。
  • 和AI测试:人与AI各司其职。腾讯、阿里、字节这三家国内AI发力较大的公司,加上开始做工程化研究的DeepSeek广告,正在推动「AI主导测试」——需求分析、用例设计、系统探索、代码编写、自动化回归等大部分工作都可以交给AI完成。
  • 对AI测试:不再讨论人机分工,而是关注如何对内嵌AI功能的软件(如AI客服、AI算命、AI视频生成等)进行测试。这类测试的思路、流程与传统软件截然不同,如今行业称之为「AI应用测试」。

这都是可以的

为什么是「评估」而不是「测试」

作者提出了一个核心观点:对AI的测试无法沿用传统的断言方式,必须转向「评估」。这不是国内某个人的发明,而是国际惯例——中外对人工智能的测试一直沿用「评估(Evaluation)」这个术语。

背后的逻辑很直观。传统软件测试依赖断言:断言状态码、断言返回数据、断言字段内容,结果只有「对」或「错」、「通过」或「失败」两种,输出一致、断言稳定可靠。但AI大模型的输出是概率性的,无法简单粗暴地判断相等与否。

作者从两个角度解释了这种概率性:

原理层面的天生概率性

主流生成式大模型大多参考了Transformer架构,而Transformer在输出时本身就存在一个概率选择的过程。因此大模型「血统中就自带天然的概率性」——你问同一个问题,它可能给出不同的回答。

Transformer是2017年由Google在论文《Attention Is All You Need》中提出的神经网络架构,目前几乎所有主流大语言模型(GPT、Claude、DeepSeek等)都以其为基础。其核心机制是「自注意力(Self-Attention)」,能够捕捉序列中任意位置之间的依赖关系。在生成文本时,模型并不是直接输出一个确定的词,而是对词表中每个词计算一个概率分布,然后按照某种采样策略(如Top-K、Top-P采样或带温度系数的Softmax)从中选取。温度参数(Temperature)越高,采样越随机,输出越多样;温度为0时趋近于确定性输出,但仍然是概率机制的特例而非真正的确定性。正是这种「按概率采样」的设计,让同一个问题在不同调用中可能产生截然不同的回答,这是大模型的架构特性,而非缺陷。

结果表现的多样性

即便结果是确定的(比如输出数字「2」),它也有大写、小写、英文、阿拉伯数字、二进制、十六进制、ASCII等无数种表现形式,风格还可能各异。更不用说模型参数、提示词等任何微小改变都会导致结果的巨大变化。相等的场景可能是对的,但不相等的场景有「几千万种」,简单断言显然不合适。

作者用了一个贴切的类比:判断一个人不能简单地说「好人」或「坏人」,那样的判断有巨大局限性;对疾病(如癌症、肿瘤、抑郁症、智商)的判断也是通过评分实现的。就像高考通过分数来体现不同人的差距一样,对模仿人的AI也应当用评分、评估的方式。

评估与断言的区别

评估不等于抛弃测试

一个容易误解的点是:转向评估是否意味着彻底放弃测试?作者明确否定了这一点。

评估的核心是「打分」——通过分数表达结果有多好、多差。但评估之上仍需要一个测试环节,相当于为分数「划定一条及格线」。就像高考有录取分数线、肿瘤和抑郁症诊断也有分数线一样,AI产品最终能否上线、能否发布,还是要给出明确结论。

实践中,AI领域的打分通常用0到1的连续值(0.1、0.2、0.9、0.999……),但也可以用0和1两个离散值来对应传统断言中的「不通过」和「满分」,实现离散化和简化。项目落地时,连续值评估和传统断言式测试都可能用到。

双版本固定:AI评估的严格要求

由于评估结果具有模糊性和波动性,作者强调AI评估对版本管理的要求比传统测试更严格,需要同时固定两个版本:

  • 被测版本:被测系统本身的版本,由使用的模型、传入的参数、使用的提示词、添加的上下文共同构成。任何一项变化(比如从DeepSeek换成GPT)都意味着被测版本改变,结果需要重新评估解读。
  • 评估版本:即用什么手段测试——数据集、断言、提示词、门槛。数据集或门槛变了,结果自然不同。

关键规则在于:只替换一个版本时可以做横向对比(比如同样测试手段下对比不同模型的质量,或同一系统下对比不同门槛的效果);但如果两个版本同时变化,就失去了对比价值,成为一个完全独立的全新评估结果。

作者还建议有性能测试经验的同学做类比——性能测试同样不特别关心对错,而是在特定条件下通过一组数据发现问题,且需要多轮对比才能提交结论,这与AI评估的思路高度相似。

评估什么:大模型、知识库、智能体三层递进

作者纠正了一个常见误区:AI评估不是上来就堆砌指标(如召回率、忠诚度)。正确的做法是先确定评估对象,因为不同对象的目的和指标完全不同。他将评估对象分为三层,且这三层是递进关系而非并列选择:

第一层:大模型(LLM)

主要评估大模型生成内容的正确性、完整性、安全性和稳定性。对DeepSeek这类模型厂商而言必测;对普通公司而言,也可用于模型选型(哪个模型更好、更快、更聪明)、提示词优化,以及有实力的公司做小模型微调后的评估。

第二层:知识库(RAG)

知识库先检索正确资料,再结合资料回答问题。评估重点在各个环节:检索准不准、忠诚度如何(生成结果是否基于指定资料)。召回率、忠诚度等指标主要用在这一层。

RAG(Retrieval-Augmented Generation,检索增强生成)是一种将外部知识库与大模型结合的技术范式。其基本流程是:用户提问后,系统先从知识库中检索与问题相关的文档片段(通常通过向量相似度计算),再将检索结果作为上下文连同原始问题一起传给大模型,由模型综合生成答案。RAG的引入解决了大模型知识截止日期和幻觉问题,是企业落地AI客服、内部知识问答的主流方案。

评估RAG系统时涉及两个关键指标:**召回率(Recall)**衡量知识库是否能检索到所有相关文档,召回率低意味着「该查到的没查到」;**忠诚度(Faithfulness)**衡量模型生成的答案是否真正基于检索到的资料,而非「自由发挥」产生幻觉。这两个环节任一失效,最终答案的质量都会大打折扣,因此需要分层评估而非只看最终输出。

第三层:智能体(Agent)

客服Agent、数据Agent、知识库Agent已较常见,未来还会有旅游、法律、医疗等各类Agent。智能体涉及任务规划、工具使用、任务推进,评估最为复杂——它包含了对工具的选择、任务的编排、知识库的使用,最根本还要使用大模型。

三层的复杂度和知识度依次递增,构成清晰的学习路线:先掌握大模型评估,再到知识库,最后到智能体。

AI评估与性能测试的类比

AI Agent(智能体)是指能够自主感知环境、制定计划、调用工具并执行多步骤任务的AI系统,区别于单次问答的大模型调用。典型的Agent架构包含三个核心组件:规划模块(将复杂目标分解为可执行步骤)、工具调用(如搜索引擎、代码执行器、数据库查询、外部API)和记忆模块(短期上下文与长期知识存储)。

Agent的评估复杂性远超单层大模型,原因在于其误差会随步骤累积——早期规划失误可能导致后续所有工具调用方向偏离,而每次工具调用本身也可能出错。评估时需关注:任务完成率、工具选择的准确性、任务路径的合理性(是否走了冗余步骤),以及最终结果的正确性。这种多步骤、多工具的特性,使得传统的单次断言完全失效,必须对整个执行轨迹进行评估。

用什么测:评测工具的选型

最后一个问题是工具。作者列举了多款AI测试工具,并重点推荐了一款他称为「Promptfoo」风格的命令行工具,理由有几点:

  • PyTest风格:对有PyTest自动化经验的同学非常友好,符合代码化测试的习惯。
  • CLI驱动:由于支持命令行方式,意味着这个工具本身可以被AI调用。「这个工具是用来评估AI的,而它自己又可以被AI使用」——未来「AI评估AI」的场景很有潜力。
  • 支持人工评估:AI评估领域中,人工评估是「金标准」(因为当前行业通识仍是AI没有人聪明),该工具支持通过YAML方式写用例断言。
  • 扩展性强:支持批量调用、支持用Python自定义。
  • 被OpenAI收购:其优秀被更优秀的公司认可。

作者也给出了差异化选型建议:做学术性指标研究的(如模型厂商)可选偏指标的工具;做线上智能体、需要生产监控跟踪的可选相应工具;而对大部分测试同学来说,评估是为了判定产品能否上线,带有验收性质,推荐的这款工具较为合适,且能覆盖大模型、知识库、智能体三层评估需求。

工具选型部分

写在最后

作者反复强调,这些理论性、方向性的内容才是整节课「最枯燥但也最有价值」的部分。后续的工具操作、脚本执行都是基于这套思维框架的具体落地。理解了「从断言到评估」的观念转变、双版本固定的方法论、以及三层评估对象的递进路线,即便没有动手实操,面试时也能聊出深度,实际接到任务时也有清晰方向。

对于正在思考2026测试就业方向的从业者,这套框架提供了一个务实的参考:AI没有让测试岗位消失,而是重新定义了它——从判断「对错」转向衡量「多好」。

分享:

相关推荐