SAGE
一种基于Schema引导的方面化拨款评估系统,将评分标准结构化为可操作检查项,并将判断与申请材料证据绑定,生成可审计草稿供人类专家复审,实现人机协作的专业评审流程
Timeline (last 90 days)
SAGE 的全称是 Schema-Guided Aspect-Based Grant Evaluation(基于 Schema 引导的方面化拨款评估),核心思路是将拨款评审的评分标准翻译成一系列结构化检查项,并把每一项判断与申请材料中的具体证据建立链接
SAGE 在 35 份非营利组织的拨款申请上进行了评估
在第一阶段事后对比中,SAGE 的评估结果与原始竞赛中 105 份人工评审对比,序数一致性为 kappa = 0.29,属于「一般」水平
在第二阶段人机协作的辅助复审模式下,基金会逐条标准再评审共产出 202 项评估,SAGE 的一致性提升到 kappa = 0.58,达到中高水平
作为对照基线,「每条标准用一个提示」(one-prompt-per-criterion)的简单方案在共同子集上只达到 kappa = 0.33,而 SAGE 达到 0.58
SAGE 在排序相关性(rank correlation)上高于简单基线,错误率更低
SAGE 引入声明级审计(claim-level audit)机制,对结构化草稿中的每个判断标注为「已确认」(confirmed)、「有争议」(disputed)或「未被覆盖」(unaddressed)
SAGE 并不试图取代人类评审员,而是生成一份详细、证据关联、可审计的初稿供专家修正
All Facts (8)
SAGE 的全称是 Schema-Guided Aspect-Based Grant Evaluation(基于 Schema 引导的方面化拨款评估),核心思路是将拨款评审的评分标准翻译成一系列结构化检查项,并把每一项判断与申请材料中的具体证据建立链接
50%UnverifiedSAGE 在 35 份非营利组织的拨款申请上进行了评估
50%Unverified在第一阶段事后对比中,SAGE 的评估结果与原始竞赛中 105 份人工评审对比,序数一致性为 kappa = 0.29,属于「一般」水平
50%Unverified在第二阶段人机协作的辅助复审模式下,基金会逐条标准再评审共产出 202 项评估,SAGE 的一致性提升到 kappa = 0.58,达到中高水平
50%Unverified作为对照基线,「每条标准用一个提示」(one-prompt-per-criterion)的简单方案在共同子集上只达到 kappa = 0.33,而 SAGE 达到 0.58
50%UnverifiedSAGE 在排序相关性(rank correlation)上高于简单基线,错误率更低
50%UnverifiedSAGE 引入声明级审计(claim-level audit)机制,对结构化草稿中的每个判断标注为「已确认」(confirmed)、「有争议」(disputed)或「未被覆盖」(unaddressed)
50%UnverifiedSAGE 并不试图取代人类评审员,而是生成一份详细、证据关联、可审计的初稿供专家修正
50%