[KongchangAI]
Product

Petri

Petri是一款开源的AI对齐评估工具,由Anthropic开发并捐赠给Meridian Labs独立运营维护。该工具旨在帮助研究人员和开发者评估AI系统的对齐性与安全性,支持对模型行为进行系统化测试与分析,是AI安全研究领域的基础设施工具之一。

Timeline (last 90 days)

May 31

Opus 4.5通过了Gray Swan开发的强对抗性提示注入测试和升级版Petri自动化评估工具测试

Unverified85%
May 31

Petri是Anthropic开发的一款开源工具,专门用于测试和评估AI模型的对齐表现

Unverified85%
May 31

双方合作发布了一次重大更新,在适应性、真实性和深度三个维度上带来了显著提升

Unverified80%
May 31

Anthropic将其开源AI对齐测试工具Petri正式捐赠给Meridian Labs

Unverified85%
May 31

Anthropic选择捐赠Petri而非继续内部维护,主要考量包括保障评估独立性、借助社区力量加速迭代、推动行业共建安全标准

Unverified75%
May 31

更新后的Petri能够更灵活地适配不同类型和规模的AI模型,大幅降低了测试门槛

Unverified75%
May 31

Petri在AI安全技术体系中属于评估环节,不负责训练模型,而是在模型训练完成后系统性地检验对齐效果

Unverified85%

Source Articles