ContextAdapt
专为大语言模型价值对齐设计的情境适应性评估框架,覆盖诚实、自主、保密三类价值,横跨医疗、法律、金融与国家安全四个高风险专业领域,通过「价值×领域」二维矩阵评估模型对专业规范及其边界的理解能力
Timeline (last 90 days)
arXiv论文《ContextAdapt》研究大语言模型能否在不同专业场景中恰当调整价值的应用方式,同时在情境变化未改变专业规范时保持一致
ContextAdapt 评估框架覆盖诚实、自主、保密三类价值,横跨医疗、法律、金融与国家安全四个高风险专业领域
ContextAdapt 依据一手的专业与监管文件搭建「价值 × 领域」的二维矩阵,并开发了测试默认专业规则和公认例外情形两类场景
ContextAdapt 研究的评估对象覆盖了12个主流大语言模型
研究不仅考察模型推荐什么行动,还考察它给出什么理由
在行动恰当性上,所有模型的平均得分达到95.6%
在使用正确的、领域特定的理由方面,不同模型的表现从25.6%一路跨越到76.9%
析因实验显示,显式点明专业领域以及改变模型所扮演的角色对模型行为的影响都很有限
改变场景的利害程度(stakes)会导致模型出现严重但局部的失效,即便底层专业义务未改变模型也会改变回应
感知到的严重性成为模型倾向于披露信息的诱因,这一现象在诚实和保密两类场景中都出现
1 more timeline events
All Facts (11)
arXiv论文《ContextAdapt》研究大语言模型能否在不同专业场景中恰当调整价值的应用方式,同时在情境变化未改变专业规范时保持一致
50%UnverifiedContextAdapt 评估框架覆盖诚实、自主、保密三类价值,横跨医疗、法律、金融与国家安全四个高风险专业领域
50%UnverifiedContextAdapt 依据一手的专业与监管文件搭建「价值 × 领域」的二维矩阵,并开发了测试默认专业规则和公认例外情形两类场景
50%UnverifiedContextAdapt 研究的评估对象覆盖了12个主流大语言模型
50%Unverified研究不仅考察模型推荐什么行动,还考察它给出什么理由
50%Unverified在行动恰当性上,所有模型的平均得分达到95.6%
50%Unverified在使用正确的、领域特定的理由方面,不同模型的表现从25.6%一路跨越到76.9%
50%Unverified析因实验显示,显式点明专业领域以及改变模型所扮演的角色对模型行为的影响都很有限
50%Unverified改变场景的利害程度(stakes)会导致模型出现严重但局部的失效,即便底层专业义务未改变模型也会改变回应
50%Unverified感知到的严重性成为模型倾向于披露信息的诱因,这一现象在诚实和保密两类场景中都出现
50%Unverified部署LLM到高风险专业场景前,高准确率表象之下模型推理依据可能不可靠,针对情境适应性的严格测评不可或缺
50%