[控场AI]
论文Praxa框架 / Evidence-Bound Harness for Governed AI Agent Execution

Praxa

一个AI智能体执行框架,通过确定性准入、经纪式执行、外部回读、对账和审核后提升五个环节,将从授权到效果的链路透明化、可测试化,实现可追溯的治理框架

时间轴 (近 90 天)

10月2日

Praxa 是一个在 arXiv 论文中提出的智能体执行框架(harness),旨在将智能体从授权到效果的链路透明化、可测试化,其核心贡献是证据绑定(evidence-bound)的架构,让智能体从授权到效果的状态转换变得显式且可测试

待验证50%
10月2日

Praxa 论文将智能体系统中的五种声明区分开来:提议(proposal)、授权(authority)、派发(dispatch)、已验证的外部效果(verified external effect)和服务提升(serving promotion)

待验证50%
10月2日

Praxa 通过确定性准入、经纪式执行、外部回读、对账和审核后提升五个环节,让每一次授权到效果的转换变得明确且可测试

待验证50%
10月2日

确定性准入(deterministic admission)是指系统在执行任何动作前,依据明确可预测的规则判断该动作是否被允许进入执行队列,而非依赖模型自身判断

待验证50%
10月2日

经纪式执行(brokered execution)意味着动作不由智能体直接触发,而是经过一个中间代理层(broker)调度,该层负责隔离、记录和限流

待验证50%
10月2日

外部回读(external read-back)指执行后主动向外部系统查询状态以确认动作是否真正生效,而非仅凭执行调用的返回值推断结果

待验证50%
10月2日

Praxa 在一个固定修订版本上的仓库内审计通过了 1,027/1,027 个单元测试和 89/89 个 Workerd 测试,对全部 363 个预期源文件进行了插桩,并满足四条覆盖率下限,但原始逐测试记录和独立复现尚不可得

待验证50%
10月2日

在 Terminal-Bench Core 0.1.1 试点中,跨 12 个精选任务,基线组与可靠性层组在严格试验下各通过 17/36,可靠性层多消耗了 37.49% 的输入 token 和 50.73% 的输出 token

待验证50%
10月2日

论文明确承认 Terminal-Bench 试点不支持优越性结论,因为可靠性层没有换来更好的成功率反而成本更高

待验证50%
10月2日

在两阶协调代理(coordination-proxy)开发对比中,基线与源作者编写的候选方案各完成 180/180 试验,候选方案少用了 37.11% 的 token、降低了 33.84% 的估算端点成本、减少了 11.63% 的步骤,但不能证明质量、延迟或生产环境行为上的改善

待验证50%

还有 3 条时间轴事件

全部知识事实 (13)

待验证

Praxa 是一个在 arXiv 论文中提出的智能体执行框架(harness),旨在将智能体从授权到效果的链路透明化、可测试化,其核心贡献是证据绑定(evidence-bound)的架构,让智能体从授权到效果的状态转换变得显式且可测试

50%
待验证

Praxa 论文将智能体系统中的五种声明区分开来:提议(proposal)、授权(authority)、派发(dispatch)、已验证的外部效果(verified external effect)和服务提升(serving promotion)

50%
待验证

Praxa 通过确定性准入、经纪式执行、外部回读、对账和审核后提升五个环节,让每一次授权到效果的转换变得明确且可测试

50%
待验证

确定性准入(deterministic admission)是指系统在执行任何动作前,依据明确可预测的规则判断该动作是否被允许进入执行队列,而非依赖模型自身判断

50%
待验证

经纪式执行(brokered execution)意味着动作不由智能体直接触发,而是经过一个中间代理层(broker)调度,该层负责隔离、记录和限流

50%
待验证

外部回读(external read-back)指执行后主动向外部系统查询状态以确认动作是否真正生效,而非仅凭执行调用的返回值推断结果

50%
待验证

Praxa 在一个固定修订版本上的仓库内审计通过了 1,027/1,027 个单元测试和 89/89 个 Workerd 测试,对全部 363 个预期源文件进行了插桩,并满足四条覆盖率下限,但原始逐测试记录和独立复现尚不可得

50%
待验证

在 Terminal-Bench Core 0.1.1 试点中,跨 12 个精选任务,基线组与可靠性层组在严格试验下各通过 17/36,可靠性层多消耗了 37.49% 的输入 token 和 50.73% 的输出 token

50%
待验证

论文明确承认 Terminal-Bench 试点不支持优越性结论,因为可靠性层没有换来更好的成功率反而成本更高

50%
待验证

在两阶协调代理(coordination-proxy)开发对比中,基线与源作者编写的候选方案各完成 180/180 试验,候选方案少用了 37.11% 的 token、降低了 33.84% 的估算端点成本、减少了 11.63% 的步骤,但不能证明质量、延迟或生产环境行为上的改善

50%
待验证

Praxa 论文明确声明当前证据不能证明对抗性安全性、生产环境安全性、通用专家级优越性、自主递归优化能力和用户收益

50%
待验证

证据绑定架构要求系统的每一个状态转换都必须附带可查验的证据,而非仅凭逻辑推断,与传统软件工程中的幂等性验证和事务日志理念一脉相承

50%
待验证

增加可靠性层会带来显著的 token 和成本开销,却未必在成功率上立竿见影,可审计性与可靠性的收益往往需要用效率成本来换取

50%

来源文章