为观察性证据正名:当随机对照试验无法回答一切

被过度神化的随机对照试验
在循证决策的语境中,随机对照试验(Randomized Controlled Trial,RCT)几乎被奉为证据金字塔的顶端。无论是医学研究、政策评估还是数据科学领域,人们习惯性地认为:只有经过随机化实验验证的结论,才配称为"可靠证据"。而观察性证据(Observational Evidence)则常常被贴上"次等""充满偏差""不足为凭"的标签。
然而,这种非黑即白的认知正在受到越来越多研究者的质疑。一篇题为《In Praise of Observational Evidence》(为观察性证据正名)的文章曾在 Hacker News 上引发热烈讨论,重新审视了观察性数据在科学发现中不可替代的价值。本文将结合这一话题,探讨观察性证据为何值得被重新认识。

什么是观察性证据
定义与基本形态
观察性证据,是指研究者在不主动干预研究对象的前提下,通过观察、记录和分析自然发生的现象所获得的数据。与随机对照试验中"人为分组、施加干预"的做法不同,观察性研究只是"如实记录世界本来的样子"。
常见的观察性研究设计包括队列研究(Cohort Study)、病例对照研究(Case-Control Study)以及横断面研究(Cross-sectional Study)。它们广泛应用于流行病学、经济学、社会科学乃至天文学等领域。
- 队列研究追踪一组具有共同特征的人群在一段时间内的健康或行为变化,适合研究暴露因素与长期结局的关联,典型代表是英国"生物银行"(UK Biobank)项目,招募50万名参与者追踪数十年;
- 病例对照研究则从结局出发,回溯比较患病组与健康对照组的历史暴露差异,以较小的样本量高效识别罕见病的风险因素;
- 横断面研究在特定时间点"切片"采集人群数据,适合描述疾病负担和特征分布,但因果推断能力相对有限。
一个被长期低估的事实
人类历史上许多重大科学突破,恰恰来自观察而非实验。天文学几乎完全建立在观察之上——没有人能"随机分配"恒星做对照实验。达尔文的进化论、板块构造学说、乃至吸烟与肺癌关系的确立,最初都源于细致的观察积累。这些例子提醒我们:科学的严谨性,并不等同于随机化实验这一单一方法。
值得一提的是,吸烟与肺癌因果关系的确立本身就是观察性研究的里程碑。1950年代,道尔(Richard Doll)与希尔(Austin Bradford Hill)通过大规模病例对照研究和队列研究积累了压倒性的流行病学证据——希尔随后提出了著名的"希尔因果准则"(Hill's Criteria),包括关联强度、一致性、特异性、时间性、生物梯度、合理性等九条判断标准,至今仍是观察性研究建立因果论证的核心参照框架,这套准则的意义恰恰在于:它为无法随机化的领域提供了系统评估因果关系的方法论工具。
延伸背景:RCT地位的历史确立
随机对照试验的现代形态可追溯至1948年英国医学研究委员会对链霉素治疗肺结核的临床试验,该试验由统计学家奥斯汀·布拉福德·希尔主持设计,首次将随机分组、盲法评估引入医学实验,被公认为现代循证医学的奠基之作。此后,RCT逐渐成为药物审批、临床指南制定的核心依据。1990年代兴起的"循证医学运动"(Evidence-Based Medicine)更将其制度化,确立了以系统综述和RCT为顶端的"证据层级金字塔"。然而,这套框架最初主要是为临床药物评估而设计的,将其不加区分地推广至政策、社会科学乃至商业决策领域,本身就值得反思。
观察性证据为何长期被低估
混杂因素的阴影
观察性研究最常被诟病的问题是混杂变量(Confounding)。由于研究对象没有被随机分组,观察到的相关关系可能并非因果关系,而是由某个未被测量的第三方因素所驱动。经典的例子是"冰淇淋销量与溺水人数正相关"——真正的原因是夏季气温这一混杂因素,而非二者之间存在直接联系。
混杂问题在统计学中有一个更具震撼力的表现形式——辛普森悖论(Simpson's Paradox):在分组数据中观察到的趋势,在合并数据后可能完全逆转。1973年加州大学伯克利分校的招生数据是经典案例:总体数据显示男性录取率高于女性,疑似存在性别歧视;但按院系分层分析后,大多数院系中女性录取率反而更高。真正的混杂因素是"院系选择"——女性更多申请竞争激烈的院系。这一案例深刻说明:混杂因素不仅会制造虚假相关,甚至会完全颠倒结论的方向。
辛普森悖论不仅是一个统计现象,其背后有严格的数学基础。当我们在分层数据上计算加权平均时,各层的样本量权重不同会导致合并后的趋势逆转。从线性代数角度看,这是向量加法方向性的体现;从概率论角度看,这涉及条件概率与边际概率之间的非单调关系。Pearl将辛普森悖论重新诠释为因果推断问题:当我们"控制"一个变量时,究竟是否应该控制,取决于该变量在因果图中的角色——若它是混杂因素则应控制,若它是中间变量则不应控制,错误的控制策略本身就会制造悖论。这一洞见将悖论从统计层面的"反直觉现象"提升为因果推断层面的核心警示。
正是因为这类陷阱的存在,RCT 才被推上神坛:随机化在理论上能够平衡各组之间的已知与未知差异,从而更干净地隔离因果效应。
但"金标准"本身也有代价
随机对照试验并非万能,其局限性往往被忽视:
- 伦理限制:我们不可能为了研究吸烟危害,随机分配一批人去吸烟数十年。
- 成本高昂:大型 RCT 动辄耗资数亿、历时多年,许多问题根本负担不起这一代价。
- 外部效度不足:为确保内部因果推断的干净性,RCT 往往采用严格的纳入/排除标准,导致受试群体高度同质化,与真实患者群体相去甚远。医学界将此现象称为"临床试验悖论"——越是严格控制内部效度,越难推广至真实世界。近年来,美国FDA于2018年正式发布"真实世界证据"(Real-World Evidence, RWE)项目框架,允许基于电子病历、医保数据等观察性来源的证据支持药物审批,标志着官方层面对观察性证据地位的重要重新评估。
- 无法回答某些问题:涉及历史事件、罕见现象或宏观系统的问题,根本无从随机化。
FDA的RWE框架是全球药物监管史上的重要转折。2016年美国《21世纪治愈法案》在立法层面首次要求FDA制定RWE使用指南,推动了2018年框架的出台。欧洲药品管理局(EMA)同期也在推进类似政策。RWE的核心数据来源包括电子病历(EHR)、医保理赔数据、患者注册数据库和可穿戴设备数据。然而,RWE的应用并非没有争议——数据质量参差不齐、编码错误、选择性记录等问题依然制约其可靠性,如何建立RWE的质量标准和审查框架,仍是监管科学的前沿议题,也折射出观察性证据从"被质疑"到"被体制化接纳"这一范式转变的复杂性。
换言之,当 RCT 无法实施或代价过高时,观察性证据往往是我们唯一能够依赖的路径。
现代方法如何为观察性证据赋能
因果推断工具的崛起
过去二十年,统计学与计算机科学的进步极大地增强了观察性数据的可信度。以 Judea Pearl 为代表的因果推断(Causal Inference)框架,提供了有向无环图(DAG)、后门准则等工具,帮助研究者系统地识别和控制混杂因素。
Judea Pearl 是图灵奖得主、加州大学洛杉矶分校教授,被誉为"因果推断之父"。他在其著作《因果性》(Causality, 2000)及科普作品《为什么》(The Book of Why, 2018)中,系统提出了"因果阶梯"(Ladder of Causation)理论,将人类认知分为三个层次:关联(seeing)、干预(doing)与反事实(imagining)。Pearl 认为,传统统计学只能处理关联层次的问题,而真正的因果推断需要引入结构因果模型(Structural Causal Model)和有向无环图(DAG)作为形式化语言——DAG 不仅能可视化变量间的因果假设,还能通过"后门准则"精确推导出控制混杂所需的最小变量集,使观察性数据的因果分析从"艺术"变为可操作的"科学"。
此外,倾向得分匹配(Propensity Score Matching)、工具变量法(Instrumental Variables)、断点回归(Regression Discontinuity)以及双重差分(Difference-in-Differences)等准实验方法,能够在无法随机化的情况下逼近因果结论。工具变量法的经典应用来自诺贝尔经济学奖得主 Joshua Angrist 对越战征兵彩票与收入关系的研究——彩票号码作为"天然随机化"的工具变量,成功剥离了服役与收入间的自我选择偏差;断点回归则利用政策阈值两侧个体高度相似的特点进行局部因果估计;双重差分依赖"平行趋势假设",Card 与 Krueger 1994年关于最低工资与就业的研究是其标志性范本。
然而,这些方法的可信度高度依赖其前提假设是否成立。双重差分法的"平行趋势假设"要求处理组与对照组在干预前具有相同的时间趋势,这一假设不可直接检验,只能通过观察干预前多期数据的趋势来间接评估。断点回归则要求政策阈值处不存在"精确操控"——即个体无法精确控制自己处于阈值哪一侧,例如考试分数型阈值就存在被操控的风险。工具变量法要求工具满足"排他性约束"(即工具只通过处理变量影响结果),这一假设往往难以被证伪。正因为每种方法都有严苛的前提条件,近年来兴起的"敏感性分析"(Sensitivity Analysis)和"安慰剂检验"(Placebo Tests)已成为评估这些方法可信度的标准配套工具,也提醒从业者:准实验方法不是绕过严谨性的捷径,而是在特定假设下进行的严格论证。
这些方法各有严格的适用前提,已成为经济学、公共卫生等领域的主流分析工具。
大数据时代的新机遇
在数据科学与 AI 时代,观察性数据的规模和维度都达到了前所未有的水平。电子健康记录、用户行为日志、传感器网络产生的海量观测数据,为发现规律提供了丰富素材。虽然"大数据不等于好数据",但结合严谨的因果推断方法,这些观察性数据能够揭示 RCT 难以触及的长尾现象与真实世界效应。
值得关注的是,大规模观察性数据与机器学习的结合催生了新兴领域——因果机器学习(Causal Machine Learning)。传统机器学习擅长从数据中发现预测模式,但预测并不等于理解因果。Susan Athey(斯坦福大学经济学教授)等人开发的"因果森林"(Causal Forest)算法,将随机森林的非参数灵活性与因果推断框架结合,能够估计异质性处理效应(Heterogeneous Treatment Effects),即同一干预对不同人群的差异化影响——这类精细化洞察,正是大样本观察性数据才能支撑的分析维度,也是未来个性化医疗与精准政策的方法论基础。
理性的证据观:互补而非对立
证据是层次,而非等级
将观察性证据与实验证据对立起来,本身就是一种误导。更成熟的观点是:不同类型的证据各有适用场景,应当互补使用。RCT 擅长在受控条件下验证特定干预的因果效应;观察性研究则擅长在真实、广阔、长期的场景中发现规律、生成假设,并验证实验结论的外部有效性。
理想的科学过程往往是二者交织:观察产生假设,实验检验假设,再回到更大规模的观察中验证结论能否推广。这种循环也体现在具体方法的设计上——"嵌套式研究"(Nested Studies)将观察性队列与随机化子实验结合,兼顾规模与因果严谨性;"三角验证"(Triangulation)策略则要求同一结论在多种研究设计下均保持一致,从而通过方法论多样性弥补单一方法的局限。
对从业者的现实启示
对于数据科学家、产品分析师和政策制定者而言,这一讨论具有直接的实践意义。在很多业务场景中,A/B 测试(本质上是 RCT)并不总是可行——可能因为样本量不足、伦理顾虑或工程成本过高。这时,掌握观察性数据的因果分析能力,往往就是区分"数据搬运工"和"真正洞察者"的关键所在。
具体而言,从业者需要培养三项核心能力:第一,因果图思维——在分析前先画出变量间的假设因果关系,识别哪些变量是混杂因素、哪些是中间变量、哪些是碰撞因子(Collider),避免错误的变量控制策略;第二,方法论匹配能力——根据数据结构和业务场景选择合适的准实验工具,例如政策变更场景优先考虑双重差分,存在自然阈值时考虑断点回归;第三,不确定性诚实表达——观察性分析的结论往往依赖不可验证的假设,诚实地披露这些假设并量化其对结论的影响,是负责任的数据分析的基本要求,也是建立分析公信力的长期基础。
结语
《为观察性证据正名》这一讨论提醒我们:科学证据的价值,不应被单一方法论所垄断。随机对照试验固然强大,但观察性证据同样是人类认识世界不可或缺的窗口。在因果推断方法日益成熟、数据规模空前庞大的今天,重新肯定观察性证据的地位,不是对严谨性的妥协,而是对科学多元性的尊重。
真正成熟的研究者,不会盲目崇拜任何一种证据形式,而是懂得根据问题的性质选择最合适的工具,并对每种证据的优势与局限保持清醒的认识。
核心要点
- 随机对照试验并非万能,其"金标准"地位是历史建构的结果,最初针对药物临床评估而设计
- 观察性证据推动了人类历史上大量重大科学发现,并拥有独特的生态位:真实世界规模、长期追踪、罕见现象发现
- 辛普森悖论等混杂陷阱的本质是因果图结构问题,而非单纯的统计现象,需要因果思维而非更多数据来应对
- 工具变量、断点回归、双重差分等准实验方法为观察性因果推断提供了严格的方法论工具,但每种方法都有不可忽视的前提假设
- FDA的RWE框架标志着制度层面对观察性证据的重新接纳,但数据质量和审查标准仍是持续挑战
- 因果机器学习等新兴领域将大规模观察性数据与因果推断结合,开启了异质性效应估计的新可能
- 成熟的证据观要求因果图思维、方法论匹配能力和不确定性的诚实表达,三者缺一不可
相关推荐

沃尔沃XC40插混版回归:传感器升级+Gemini AI加持
沃尔沃XC40 PHEV插电式混动版时隔三年重返市场,带来全新外观设计、升级传感器套件及谷歌Gemini AI车机系统。了解这款车型的核心升级亮点、插混回归的市场逻辑及生成式AI进入座舱的深远意义。

暴雪工会赢得历史性合同:游戏业劳工运动迎来转折点
暴雪娱乐员工成功签订历史性工会合同,成为游戏行业劳工运动的里程碑事件。本文深入分析游戏业长期缺乏工会的结构性原因、微软收购后的态度转变,以及这一先例对整个科技和游戏行业劳工权益的深远影响。

AI产品发布新范式:团队心血与用户社区的双向奔赴
探析AI产品发布中情感叙事与社区驱动增长的新趋势。从一条引发行业关注的推文出发,解读AI团队如何通过真诚投入、开放试用和社区建设,实现产品与用户的双向奔赴,构筑长期竞争壁垒。