[控场AI]
产品Inspect框架 / Inspect评估框架

Inspect

由英国AI安全研究所(UK AI Safety Institute)主导开发的开源大语言模型评估框架,围绕数据集、求解逻辑与评分机制三条主线,将评测流程拆解为结构化、可组合、可复用的工作流,尤其强调安全性评估场景和Agent行为测试的可组合性

时间轴 (近 90 天)

9月30日

Inspect 围绕数据集、求解逻辑与评分机制这三条主线,把评测流程拆解成模块

待验证50%
9月30日

可组合评估架构的核心价值在于将环境模拟、轨迹记录与评分逻辑解耦,使团队能针对不同 agent 任务灵活组装评估流水线

待验证50%
9月30日

开源评估框架带来可复现性与透明度,因为评估逻辑、数据处理和评分标准以代码形式公开

待验证50%
9月30日

Inspect 是一个开源的大语言模型评估框架,目标是为 LLM 的能力评测提供通用基础设施

待验证50%
9月30日

Inspect 在设计上尤为强调安全性评估场景和 agent 行为测试的可组合性

待验证50%
9月27日

Ramp的Inspect已累计上百万次会话,75%的PR由它构建,过去一个月有1000个PR是非工程师提交的

待验证50%
9月27日

Ramp自研了编码agent Inspect,跑在Slack里,5秒内响应,并能返回可交互的部署预览

待验证50%

全部知识事实 (7)

来源文章