[控场AI]
· 4 分钟阅读· 2,480 字

皮尤研究中心如何在研究中使用与不使用AI

皮尤研究中心如何在研究中使用与不使用AI

皮尤研究中心公开划定AI使用边界:辅助性环节可用,核心可信度环节严守人工把关。

皮尤研究中心近期公开阐述了其AI使用政策:以透明的边界划定来保护机构公信力。在允许使用AI的环节,主要集中于文本分类、开放式问卷编码、文献检索与摘要等辅助性、低风险工作,且全程须有人工校验。而研究结论生成、用AI模拟受访者替代真实调查数据、以及无人监督的自动化发布,则被明确列为禁区。这一"分层策略"的核心逻辑在于:大语言模型的随机性与不可追溯性,与研究机构对可复现性和方法论透明度的根本要求存在冲突,因此判断标准不是"AI能否做到",而是"交给AI是否会损害成果可信度"。皮尤的表态为整个知识生产领域提供了一个务实的治理参考框架。

皮尤研究中心如何在研究中使用与不使用AI

作为美国最具影响力的民意调查与社会研究机构之一,皮尤研究中心(Pew Research Center)近期公开阐述了其在研究工作中对人工智能的态度与实践边界。这一表态本身颇具行业意义——在生成式AI快速渗透各行各业的当下,一家以数据严谨性和方法论透明著称的研究机构,如何划定AI的使用范围,为整个知识生产领域提供了值得参考的样本。

说明:本文基于皮尤研究中心公开的官方说明(经 Hacker News 讨论传播)整理撰写。由于原始素材信息有限,部分内容为对研究机构应用AI通用实践的合理延伸分析,读者可参考原文获取完整细节。

一家研究机构为何要主动划清AI边界

对于皮尤这样的机构而言,可信度是其存在的根基。研究结论一旦被质疑掺杂了不可解释的算法输出,其社会公信力将受到严重冲击。因此,主动、透明地说明"我们用AI做什么、不用AI做什么",是一种防御性的公信力管理。

这种做法与许多急于宣传"全面拥抱AI"的商业公司形成鲜明对比。研究机构的核心资产是方法论的可复现性与可解释性,而当前的大语言模型恰恰在这两点上存在天然短板——输出具有随机性、内部逻辑难以追溯。主动设限,实际上是在保护研究成果的严肃性。

皮尤研究中心关于AI使用的官方说明

大语言模型在"可解释性"上的结构性缺陷,是研究机构审慎态度的技术根源。当前主流的生成式AI(如GPT系列、Claude等)本质上是基于海量文本训练的概率预测系统,其输出是对训练分布中"最可能"出现的语言序列的采样,而非对某个逻辑推理链的显式执行。这导致两个核心问题:其一,同一问题在不同时间、不同随机种子下可能产生不同答案,违背科学研究对"可复现性"的基本要求;其二,模型无法提供人类可审计的推理轨迹,研究者事后难以判断某一结论究竟从何而来、哪些训练数据产生了影响。这与统计学研究对"透明方法论"的要求存在根本冲突。正因如此,将AI输出直接纳入研究结论,在方法论层面相当于引入了一个"黑箱变量",会直接动摇研究的同行评审基础。

AI可能被用在哪些辅助性环节

从研究机构的通用实践来看,AI更适合承担"辅助工具"而非"决策主体"的角色。这类应用通常集中在几个低风险、高效率的环节。

数据处理与文本分类

在处理海量开放式问卷回答、社交媒体文本或新闻语料时,AI可以显著提升编码(coding)和分类效率。传统上这类工作需要大量人工标注,而机器学习模型能够在人工校验的前提下加速初步归类。关键在于,最终的分类标准和质量把关仍由研究人员掌控。

这里提到的"编码"(coding)是质性与量化研究中的核心操作,指将非结构化的文本回答归入预设或涌现的类别体系,以便进行统计分析。传统的人工编码通常需要多名研究员独立标注同一批文本,再计算编码者间信度(inter-rater reliability,常用Cohen's Kappa系数衡量),以确保分类标准的一致性和客观性。整个过程耗时极长,尤其当语料规模达到数万条时,成本几乎难以承受。引入AI辅助编码的主要价值,正在于将研究人员从重复性的初步标注中解放出来,专注于标准制定、边界案例判断和最终质量审核。然而,AI编码同样需要经过系统性的效度验证——即抽样对比AI分类结果与人工标注结果的吻合程度——才能作为可信的研究步骤纳入方法论说明,否则会给同行评审留下方法漏洞。

内容摘要与信息检索

面对庞大的历史研究档案和文献,AI可作为检索与摘要的辅助手段,帮助研究者快速定位相关材料。但这类摘要通常需要人工核对,避免模型"幻觉"引入错误信息。

AI明确不会被用在哪些核心环节

真正体现机构立场的,是那些被明确排除在AI之外的环节。这些"红线"往往关乎研究的核心可信度。

不用于生成研究结论

研究结论必须建立在可追溯的数据分析之上,而非模型的概率性输出。让AI"写结论"意味着放弃对因果逻辑和统计推断的人工掌控,这是任何严肃研究机构都无法接受的。

不用于替代调查数据本身

用AI"模拟"受访者回答、生成合成数据来替代真实民意调查,是近年来备受争议的做法。对皮尤而言,其核心价值正是来自真实人群的真实回答,用AI生成数据无异于自毁根基。

用AI生成合成调查数据的争议,近年来在学术界和政策研究圈愈演愈烈。部分研究者提出"硅基受访者"(silicon sampling)概念,即用大语言模型模拟不同人口特征群体的观点,以降低调查成本。支持者认为,在某些探索性研究阶段,合成数据可以快速提供方向性参考;但批评者指出,大语言模型的训练数据本身存在严重的人口偏差——英语互联网用户、受教育程度较高群体被过度代表,而老年人、农村群体、非主流语言使用者的声音则极度匮乏。这意味着AI"模拟"出的民意,实际上是对已有偏见数据的再放大,而非对真实社会结构的客观映射。对于皮尤这类依赖代表性样本来描述美国乃至全球民意的机构,一旦采用合成数据,其研究结论的外部效度(external validity)将从根本上失去保障。

不用于无人监督的自动化发布

任何对外发布的内容都需经过人工审核,避免未经核实的AI生成内容以机构名义发出。

对整个行业的启示

皮尤的表态提供了一个务实的框架:在效率环节大胆用AI,在可信度环节严守人工把关。这种分层策略比"全盘拥抱"或"全盘拒绝"都更成熟。

对于其他内容生产者、媒体和研究组织,这一案例的价值在于——AI政策不应只是技术选型问题,更是关乎机构信誉与伦理责任的治理问题。透明地公开使用边界,本身就是建立信任的重要一环。

随着生成式AI能力持续增强,"哪些工作值得交给AI、哪些必须由人类负责"的讨论只会愈发重要。皮尤的做法提醒我们:判断标准不应是"AI能不能做",而是"这项工作交给AI会不会损害成果的可信度"。

分享:

相关推荐