LEGO框架:GraphRAG与专家思维链协同破解法律推理难题

LEGO框架通过专家规范图谱与结构化法律推理链,让8B小模型追平大模型的复杂法律推理能力。
LEGO 是一个针对大语言模型法律推理的双模块框架,旨在同时解决现有方法的两大结构性缺陷:基于语义相似度的 RAG 忽略法律条文间的规范性关系,以及普通思维链无法约束法律推理的规范结构。框架由 ExpertGraphRAG 和 ExpertCoT 两个组件构成:前者利用专家标注的民法典规范关系图谱,通过贪心"规范覆盖"算法为每个案例动态抽取条文子图;后者将检索结果组织为"条文—事实—结论"的法律三段论推理链。在 LawExamQA_Civil 数据集上,以 Qwen3-8B 为骨干的 LEGO 取得 40.53% 精确匹配准确率,超越各 RAG/CoT 基线并追平更大规模模型,在多跳推理任务上尤为稳健。消融实验进一步确认两模块各自独立贡献且相互增强。代码与数据集已开源。
大模型进入法律领域的两道结构性门槛
大语言模型正在被越来越多地应用于法律、医疗等高风险领域,但复杂的法律推理仍受到两个结构性问题的制约。一是现有的 RAG 与 GraphRAG 方法过度依赖词汇或语义相似度,忽略了法律条文之间的规范性关系(normative relations)。二是普通的思维链(Chain-of-Thought,CoT)提示往往能生成看似合理的推理过程,却无法真正约束法律推理所应遵循的规范结构。
换句话说,检索环节找到的条文可能"字面相近却规范无关",而推理环节则可能"逻辑通顺却于法无据"。这两个问题叠加,使得LLM在处理需要多跳推理的复杂法律问题时表现受限。arXiv 上新公布的 LEGO 框架正是针对这两个瓶颈提出的解决方案。

RAG(Retrieval-Augmented Generation,检索增强生成)是一种将外部知识库与语言模型结合的架构:系统先从文档库中检索与问题相关的片段,再将其作为上下文喂给模型生成答案,以此弥补模型参数知识的局限。GraphRAG 是 RAG 的图结构扩展,它将知识组织为图(节点代表实体或文档,边代表关系),检索时沿图中的连接关系进行多跳遍历,理论上能捕获更复杂的关联。然而两者的检索信号本质上都基于语义相似度——即查询与候选文本在向量空间中的距离——这在通用问答场景中已足够有效,但在法律场景中却存在根本性缺陷:两条语义毫不相似的条文可能通过"特别法优于一般法""例外条款"等规范关系紧密耦合,而两条字面高度相近的条文在规范逻辑上可能毫无关联。这正是 LEGO 所要解决的核心矛盾。
LEGO的双模块设计思路
LEGO 是一个双模块框架,核心思想是让"法律专家式的检索"与"法律专家式的推理"协同工作,分别对应 ExpertGraphRAG 和 ExpertCoT 两个组件。
ExpertGraphRAG:基于规范关系的图检索
第一个模块 ExpertGraphRAG 使用一张由专家标注的民法典图谱(civil code graph),这张图谱显式编码了条文之间的规范性关系,而非单纯的语义相似度。在检索时,它采用一种贪心式的"规范覆盖"(normative-coverage)检索算法,动态地为每个具体案例抽取与之相关的条文子图(provision subgraph)。
这种做法的价值在于:法律条文之间存在引用、限定、例外、适用条件等复杂关系,只有把这些规范关系纳入检索,才能保证找到的条文在法律逻辑上是完整且相关的,而不是仅仅在文字上相似。
ExpertCoT:条文-事实-结论的结构化推理
第二个模块 ExpertCoT 负责推理。它把检索到的条文和案件事实组织成"条文—事实—结论"(Provision-Fact-Conclusion)的结构化推理链条。这一结构本质上是对法律三段论的模拟:以法律条文为大前提、以案件事实为小前提、推导出结论。
相比放任模型自由生成推理,这种结构化约束能有效抑制"貌似合理但不符合法律规范结构"的推理产出,让推理过程更贴近专业法律人的思考方式。
法律三段论(legal syllogism)是大陆法系法律适用的基本逻辑框架,其结构为:大前提(法律规范:满足条件 C 则产生法律效果 E)、小前提(案件事实:本案满足条件 C)、结论(本案应产生法律效果 E)。这一形式逻辑结构确保了司法裁判的可预测性与可审查性,也是法律职业训练的核心。普通思维链提示让模型自由展开推理步骤,虽然往往能产出流畅的文字,但并不强制模型遵循"先找规范、再对应事实、最后得出结论"的顺序,容易出现用常识推断替代规范引用、或先预设结论再倒推理由的问题。ExpertCoT 将三段论结构硬编码为推理模板,迫使模型在每一步都明确对应条文来源,从而使推理过程在形式上可验证、在逻辑上可追溯。
实验结果:小模型达到大模型水准
研究团队以 Qwen3-8B 作为骨干模型进行验证。在 LawExamQA_Civil 数据集上,LEGO 取得了 40.53% 的精确匹配(exact-match)准确率,超过了参与评测的 RAG 与 CoT 基线方法,并且表现与所评测的更大规模模型相当。
这是一个值得关注的信号:通过引入领域专家知识(规范图谱)与结构化推理约束,一个 8B 规模的模型可以在专业法律推理任务上追平参数量更大的模型。这对于追求成本与效果平衡的实际部署场景颇具吸引力。
此外,LEGO 在多跳(multi-hop)问题上保持了稳健性,这类问题往往需要串联多个条文才能得出结论,恰恰是普通 RAG 容易失效的地方。在开放式(open-ended)基准测试中,LEGO 也在所评估的基线中取得了最佳结果。
精确匹配(Exact Match,EM)是问答任务中的严格评估指标,要求模型输出与标准答案完全一致(通常在规范化处理后逐字符比对),不接受部分正确。与 F1 分数或人工评分相比,EM 对法律问答尤为适合,因为法律结论通常是确定性的——引用错误条文编号或遗漏关键限定词均视为错误。40.53% 的 EM 准确率乍看不高,但需置于法律多跳推理任务的难度背景下理解:该类问题要求模型串联多个条文、准确识别适用条件并排除例外,现有通用模型基线通常显著低于这一水平。以 8B 参数模型达到与更大规模模型相当的成绩,说明领域知识结构的引入对性能的增益可以部分替代参数规模的增益。
消融实验验证双模块的互补价值
消融实验(ablation studies)确认了两个模块各自的独立贡献以及二者的互补性。也就是说,ExpertGraphRAG 与 ExpertCoT 不是简单叠加,而是相互增强——好的检索为结构化推理提供了准确的条文基础,而结构化推理又能充分利用检索到的规范关系。
这一结果印证了框架设计的初衷:法律推理的两个瓶颈本质上是耦合的,只有同时解决"找对条文"和"用对逻辑",才能真正提升 LLM 的复杂法律推理能力。
意义与展望
LEGO 的价值不仅在于刷新了某个基准的分数,更在于提供了一种将领域规范知识注入检索与推理全流程的范式。对于法律、医疗、金融等强监管、强规范的领域,单纯依赖语义相似度的通用 RAG 往往力不从心,而 LEGO 展示的"专家标注图谱 + 结构化推理"路线,可能是让通用大模型胜任高风险专业任务的一条现实路径。
研究团队已开源代码与数据集(GitHub: BLK-WHT/LEGO),有兴趣的开发者和研究者可以进一步复现与拓展。
相关推荐

智能体底座(Harness)比模型本身更关键:YC深度解析Agent架构演进
YC在Harness Night分享会上提出:决定智能体能力的关键不是模型本身,而是外层的Harness底座。本文梳理从GPT-2到自改进Harness的演进,解析Prime Agent、OpenJarvis、QM三大实践及Agent架构设计要点。

用n8n搭建LinkedIn线索抓取与丰富化自动工作流
一套基于n8n的LinkedIn线索抓取与丰富化自动工作流:只需填写职位、地点、行业和公司规模,系统即可自动生成含专业邮箱和验证状态的客户名单并写入Google表格。本文解析其流程、输出字段与合规注意事项。

SageMaker HyperPod:跨团队共享GPU集群的隔离与公平性实践
Amazon SageMaker HyperPod 推出跨团队共享GPU集群的参考架构,通过IAM Identity Center认证、Kubernetes命名空间隔离、Task Governance公平调度和成本分摊,实现算力安全共享与费用透明化。