IntLawNER
IntLawNER是国际法领域首个命名实体识别数据集与基准,涵盖ICJ判决、联合国安理会决议及ECtHR裁决,包含2987个人工标注句子和8094个实体片段,采用基于机构职能的七类实体标注体系
Timeline (last 90 days)
IntLawNER 是国际法领域首个面向成文国际法源的词元级命名实体识别(NER)数据集与基准
IntLawNER 的语料来自三大法律来源:国际法院(ICJ)判决、联合国安理会决议、以及欧洲人权法院(ECtHR)裁决
IntLawNER 包含 2,987 个人工黄金标注句子和 8,094 个实体片段,按机构特性划分为七种实体类型
研究团队将原始的 46.8 万句源文本压缩为精简的标注集合
IntLawNER 的标注流水线包含候选检索、基于大语言模型的审查和人工复核三个环节
在最终黄金标注中,有 89.6% 的实体片段直接从银层(机器初步标注结果)原封不动被接受
在边界匹配的片段上 Cohen's kappa 达到 0.964,但纳入遗漏实体、边界错误和标签修正后宏观 F1 骤降至 0.753
零样本的基于片段的 GLiNER 模型在依赖机构职能的实体类型上几乎完全失效,微观 F1 仅为 0.243
当提示中包含展示标签对比的少样本样例时,所有大语言模型的表现都超越了零样本提示
在 IntLawNER 基准中,Claude Opus 4.6 取得最佳成绩,微观 F1 达到 0.873
2 more timeline events
All Facts (12)
IntLawNER 是国际法领域首个面向成文国际法源的词元级命名实体识别(NER)数据集与基准
50%UnverifiedIntLawNER 的语料来自三大法律来源:国际法院(ICJ)判决、联合国安理会决议、以及欧洲人权法院(ECtHR)裁决
50%UnverifiedIntLawNER 包含 2,987 个人工黄金标注句子和 8,094 个实体片段,按机构特性划分为七种实体类型
50%Unverified研究团队将原始的 46.8 万句源文本压缩为精简的标注集合
50%UnverifiedIntLawNER 的标注流水线包含候选检索、基于大语言模型的审查和人工复核三个环节
50%Unverified在最终黄金标注中,有 89.6% 的实体片段直接从银层(机器初步标注结果)原封不动被接受
50%Unverified在边界匹配的片段上 Cohen's kappa 达到 0.964,但纳入遗漏实体、边界错误和标签修正后宏观 F1 骤降至 0.753
50%Unverified零样本的基于片段的 GLiNER 模型在依赖机构职能的实体类型上几乎完全失效,微观 F1 仅为 0.243
50%Unverified当提示中包含展示标签对比的少样本样例时,所有大语言模型的表现都超越了零样本提示
50%Unverified在 IntLawNER 基准中,Claude Opus 4.6 取得最佳成绩,微观 F1 达到 0.873
50%Unverified国际法文本中存在大量机构职能依赖型实体,其实体类型取决于在特定法律程序中所扮演的角色而非字面词语
50%UnverifiedIntLawNER 作为可复用资源被公开发布,主要用于提取国际法律文本中的引用与实体
50%