HERMES:用知识图谱从临床文本预测患者结局

HERMES用LLM抽取个性化知识图谱、再以图注意力网络建模,将临床文本的关系结构转化为更优的患者结局预测能力。
HERMES是一个完全基于临床文本的图神经网络预测框架,针对现有方法将临床笔记压平为序列、丢失关系与时序结构的痛点而设计。其核心流程分两步:首先用大语言模型从患者临床笔记中引导抽取实体与关系,构建个性化知识图谱,并通过"对比逻辑建模"显式捕捉时间演变、治疗失败和结局变化这三类临床动态;其次用图注意力网络(GAT)在该图谱上学习患者整体表征。在MIMIC-III和MIMIC-IV数据集的院内死亡率与30天再入院两项预测任务上,HERMES持续优于纯文本基线,从实证层面支持了"显式关系建模能提升临床预测性能"的判断。论文亦存在局限:具体性能提升幅度、LLM抽取错误的传播影响及计算成本均未充分披露,且结论主要基于重症监护场景,泛化能力有待验证。
从结构化数据到临床文本:预测模型的新路径
临床预测模型长期以来依赖结构化的电子健康记录(EHR)数据,比如时间序列指标和诊疗代码。这类数据规整、易于建模,但它们只是临床现实的一部分。医生在病程记录、护理笔记中留下的大量非结构化文本,往往承载着更丰富的诊疗逻辑——治疗为何调整、患者对某种方案的反应如何、病情如何随时间演变。
近年来已有研究开始利用这些临床文本,但主流做法是把它们编码为扁平的序列(flat sequences)。这种处理方式虽然简单,却存在明显缺陷:临床叙事中原本蕴含的显式关系结构与时间结构会在压平的过程中被稀释甚至丢失。一段记录里"用药A无效后改用药B,症状缓解"这样的因果与时序链条,在序列编码里可能只剩下词语的先后顺序。
针对这一痛点,arXiv 上的一篇新论文提出了 HERMES 框架,主张完全基于临床文本、同时保留临床关系结构来做患者结局预测。

HERMES 的两个核心设计
HERMES 是一个基于图(graph-based)的框架,其技术路线建立在两个关键想法之上。
个性化知识图谱与对比逻辑建模
第一步是为每位患者构建个性化知识图谱(Personalized Knowledge Graphs)。这里的做法是借助大语言模型(LLM)从临床笔记中进行引导式抽取,把文本中的实体与关系提取出来,组织成图结构。
真正的亮点在于所谓的对比逻辑建模(Contrastive Logic Modeling)。它不只是抽取静态事实,而是显式地捕捉三类关键的临床动态:时间演变(temporal dynamics)、治疗失败(treatment failures),以及结局的变化(changes in outcomes)。换句话说,模型试图理解的不是"患者有什么",而是"发生了什么、什么没起作用、结果如何改变"。这种对治疗失败与转归变化的显式建模,恰恰是扁平序列难以表达的。
知识图谱(Knowledge Graph)是一种以节点表示实体、以有向边表示关系的图结构数据表示方式。在生物医学领域,已有 UMLS、SNOMED CT 等通用医学知识图谱,但它们记录的是群体层面的医学知识,无法反映某位具体患者的个体化诊疗历程。HERMES 所构建的"个性化"知识图谱,针对的正是这一空白——从单个患者的临床笔记中抽取该患者特有的实体(如具体药物、检查结果、症状描述)及其关系,形成仅属于该患者的图结构。这与将通用医学知识库迁移至下游任务的做法有本质区别:前者是自下而上从文本生成图,后者是自上而下从知识库检索匹配。LLM 在此扮演的是"结构化信息抽取器"的角色,将非结构化的自由文本转换为可计算的图表示,而非直接用于生成预测。
图注意力网络合成患者表征
第二步,HERMES 使用**图注意力网络(Graph Attention Network, GAT)**在构建好的知识图谱上进行图学习,从而合成出患者的整体表征。相比简单地把文本喂给编码器,图注意力机制能够根据关系的重要性对不同节点和边加权,让模型聚焦于对预测结局更关键的临床关联。
这两步结合,使得 HERMES 在保留临床关系的前提下,把非结构化文本转化为可供预测的结构化表征。
图注意力网络(Graph Attention Network, GAT)是图神经网络(GNN)家族中的一种重要变体,由 Veličković 等人于 2018 年提出。其核心思想是在聚合邻居节点信息时引入注意力机制,让模型自动学习不同邻居对中心节点的重要性权重,而非像早期图卷积网络(GCN)那样对所有邻居一视同仁地平均。在临床知识图谱的语境下,这一设计具有明确的直觉意义:并非患者图谱中的每条关系都对预测结局同等重要,"用药后肾功能恶化"这条边可能比"患者曾做过心电图"更值得关注。GAT 的注意力权重可以动态地将模型的"关注点"导向那些与预测目标更相关的临床关联,从而生成更具判别力的患者整体表征。
实验验证:在 MIMIC 数据集上的表现
研究团队在两个广泛使用的公开临床数据库 MIMIC-III 和 MIMIC-IV 上进行了验证,任务是两个经典的临床预测问题:
- 院内死亡率预测(in-hospital mortality)
- 30 天再入院预测(30-day readmission)
结果显示,HERMES 在这些任务上持续优于强大的纯文本基线模型(text-only baselines)。论文由此得出结论:通过对比逻辑建模进行显式的关系建模,能够显著提升预测性能。
这一发现的意义在于,它从实证角度支持了一个判断——临床文本中的关系与时序结构不是可有可无的装饰,而是携带预测价值的信息。把文本压成序列,本质上是在丢弃这些信号;而用图来保留它们,则能换来实打实的性能提升。
MIMIC(Medical Information Mart for Intensive Care)是由美国麻省理工学院与贝斯以色列女执事医疗中心共同维护的公开临床数据库,是临床 AI 研究领域最广泛使用的标准测试平台之一。MIMIC-III 涵盖 2001—2012 年间约 4 万名重症监护患者的数据,MIMIC-IV 则将时间范围延伸至 2008—2019 年并扩充了数据规模与质量。两个版本均包含结构化数据(生命体征时序、实验室检验、ICD 诊断码)和非结构化数据(医生病程记录、护理笔记、出院小结),是验证文本挖掘与结构化数据融合方法的理想场景。院内死亡率预测和 30 天再入院预测是该数据集上被研究最多的两个任务,已有大量公开基线结果,便于横向比较,这也是 HERMES 选择这两项任务作为验证基准的原因。
意义与局限
HERMES 提供了一个值得关注的思路:在医疗 AI 越来越多地引入大语言模型的当下,如何让 LLM 不只是充当"文本压缩器",而是成为结构化知识的抽取器。用 LLM 引导抽取、再用图神经网络学习,形成了一条"文本 → 知识图谱 → 表征"的清晰管线。
对比逻辑建模强调治疗失败与结局变化,这一设计对临床决策场景尤其契合——医生关心的往往正是"哪些干预没有奏效"这类反事实与转折信息。
当然,作为一篇预印本,其结论仍需谨慎看待。论文摘要中并未披露具体的性能提升幅度、LLM 抽取的准确率与错误传播情况,以及知识图谱构建的计算成本。LLM 抽取本身可能引入幻觉或错误关系,这些噪声如何影响下游预测,是这类方法落地前必须回答的问题。此外,MIMIC 数据集虽然经典,但主要来自重症监护场景,模型在更广泛临床环境下的泛化能力仍有待检验。
总体而言,HERMES 代表了临床预测建模从"序列思维"向"关系思维"演进的一个具体尝试,为如何更充分地挖掘临床文本价值提供了有价值的参考。
相关推荐

MrBeast百万美元挑战:吃空整家超市的内容工业拆解
深度拆解MrBeast百万美元吃空超市挑战:430万卡路里、202天封闭拍摄、规则设计与人物成长,解析头部内容创作者的工业化方法论与商业慈善双线叙事。

Cloudflare 推出 OHTTP 网关:隐私保护的新基础设施
Cloudflare 宣布推出 OHTTP 网关服务,通过中继与网关职责分离,将用户身份与请求内容解耦,为应用遥测、隐私合规等场景提供托管式隐私保护基础设施。本文解析 OHTTP 原理、信任模型与适用局限。

AI 自动化冷邮件:从网站痛点生成个性化外联的实战思路
一位网页设计从业者分享如何用 AI 工具 Swokei 自动诊断潜在客户网站的设计、速度、移动端与 SEO 问题,并生成个性化冷邮件,重构 B2B 外联工作流。本文解析其价值、分工逻辑与合规边界。