MAGS
一种多智能体自动形式化框架,将形式化验证的严谨性与LLM智能体的自动化能力结合,通过Dafny作为验证感知中间表示,为AI生成代码提供机器可检验的安全保证
时间轴 (近 90 天)
MAGS(Multi-agent Auto-formalization Guarantees Safety)是一个统一的多智能体框架,旨在生成同时具备形式化安全保证的可执行程序
MAGS采用Dafny作为验证感知的中间表示(verification-aware intermediate representation)
MAGS的工作流包括:冻结经过人工审计的API和安全需求作为不可变验证基准、将LLM生成代码翻译为Dafny、基于验证器反馈自动修复、编译回可执行代码
研究团队在三类任务上评估了MAGS:100个CUDA内核、100个终端脚本、20个机械臂任务,总计220个样本
MAGS在全部220个样本中达到了100%的成功率,针对冻结规范生成了具有非平凡安全保证的程序
MAGS的一类失败模式出现在自动形式化后的语义未能完整捕捉目标行为时
全部知识事实 (6)
MAGS(Multi-agent Auto-formalization Guarantees Safety)是一个统一的多智能体框架,旨在生成同时具备形式化安全保证的可执行程序
50%待验证MAGS采用Dafny作为验证感知的中间表示(verification-aware intermediate representation)
50%待验证MAGS的工作流包括:冻结经过人工审计的API和安全需求作为不可变验证基准、将LLM生成代码翻译为Dafny、基于验证器反馈自动修复、编译回可执行代码
50%待验证研究团队在三类任务上评估了MAGS:100个CUDA内核、100个终端脚本、20个机械臂任务,总计220个样本
50%待验证MAGS在全部220个样本中达到了100%的成功率,针对冻结规范生成了具有非平凡安全保证的程序
50%待验证MAGS的一类失败模式出现在自动形式化后的语义未能完整捕捉目标行为时
50%