Praxa
一个AI智能体执行框架,通过确定性准入、经纪式执行、外部回读、对账和审核后提升五个环节,将从授权到效果的链路透明化、可测试化,实现可追溯的治理框架
Timeline (last 90 days)
Praxa 是一个在 arXiv 论文中提出的智能体执行框架(harness),旨在将智能体从授权到效果的链路透明化、可测试化,其核心贡献是证据绑定(evidence-bound)的架构,让智能体从授权到效果的状态转换变得显式且可测试
Praxa 论文将智能体系统中的五种声明区分开来:提议(proposal)、授权(authority)、派发(dispatch)、已验证的外部效果(verified external effect)和服务提升(serving promotion)
Praxa 通过确定性准入、经纪式执行、外部回读、对账和审核后提升五个环节,让每一次授权到效果的转换变得明确且可测试
确定性准入(deterministic admission)是指系统在执行任何动作前,依据明确可预测的规则判断该动作是否被允许进入执行队列,而非依赖模型自身判断
经纪式执行(brokered execution)意味着动作不由智能体直接触发,而是经过一个中间代理层(broker)调度,该层负责隔离、记录和限流
外部回读(external read-back)指执行后主动向外部系统查询状态以确认动作是否真正生效,而非仅凭执行调用的返回值推断结果
Praxa 在一个固定修订版本上的仓库内审计通过了 1,027/1,027 个单元测试和 89/89 个 Workerd 测试,对全部 363 个预期源文件进行了插桩,并满足四条覆盖率下限,但原始逐测试记录和独立复现尚不可得
在 Terminal-Bench Core 0.1.1 试点中,跨 12 个精选任务,基线组与可靠性层组在严格试验下各通过 17/36,可靠性层多消耗了 37.49% 的输入 token 和 50.73% 的输出 token
论文明确承认 Terminal-Bench 试点不支持优越性结论,因为可靠性层没有换来更好的成功率反而成本更高
在两阶协调代理(coordination-proxy)开发对比中,基线与源作者编写的候选方案各完成 180/180 试验,候选方案少用了 37.11% 的 token、降低了 33.84% 的估算端点成本、减少了 11.63% 的步骤,但不能证明质量、延迟或生产环境行为上的改善
3 more timeline events
All Facts (13)
Praxa 是一个在 arXiv 论文中提出的智能体执行框架(harness),旨在将智能体从授权到效果的链路透明化、可测试化,其核心贡献是证据绑定(evidence-bound)的架构,让智能体从授权到效果的状态转换变得显式且可测试
50%UnverifiedPraxa 论文将智能体系统中的五种声明区分开来:提议(proposal)、授权(authority)、派发(dispatch)、已验证的外部效果(verified external effect)和服务提升(serving promotion)
50%UnverifiedPraxa 通过确定性准入、经纪式执行、外部回读、对账和审核后提升五个环节,让每一次授权到效果的转换变得明确且可测试
50%Unverified确定性准入(deterministic admission)是指系统在执行任何动作前,依据明确可预测的规则判断该动作是否被允许进入执行队列,而非依赖模型自身判断
50%Unverified经纪式执行(brokered execution)意味着动作不由智能体直接触发,而是经过一个中间代理层(broker)调度,该层负责隔离、记录和限流
50%Unverified外部回读(external read-back)指执行后主动向外部系统查询状态以确认动作是否真正生效,而非仅凭执行调用的返回值推断结果
50%UnverifiedPraxa 在一个固定修订版本上的仓库内审计通过了 1,027/1,027 个单元测试和 89/89 个 Workerd 测试,对全部 363 个预期源文件进行了插桩,并满足四条覆盖率下限,但原始逐测试记录和独立复现尚不可得
50%Unverified在 Terminal-Bench Core 0.1.1 试点中,跨 12 个精选任务,基线组与可靠性层组在严格试验下各通过 17/36,可靠性层多消耗了 37.49% 的输入 token 和 50.73% 的输出 token
50%Unverified论文明确承认 Terminal-Bench 试点不支持优越性结论,因为可靠性层没有换来更好的成功率反而成本更高
50%Unverified在两阶协调代理(coordination-proxy)开发对比中,基线与源作者编写的候选方案各完成 180/180 试验,候选方案少用了 37.11% 的 token、降低了 33.84% 的估算端点成本、减少了 11.63% 的步骤,但不能证明质量、延迟或生产环境行为上的改善
50%UnverifiedPraxa 论文明确声明当前证据不能证明对抗性安全性、生产环境安全性、通用专家级优越性、自主递归优化能力和用户收益
50%Unverified证据绑定架构要求系统的每一个状态转换都必须附带可查验的证据,而非仅凭逻辑推断,与传统软件工程中的幂等性验证和事务日志理念一脉相承
50%Unverified增加可靠性层会带来显著的 token 和成本开销,却未必在成功率上立竿见影,可审计性与可靠性的收益往往需要用效率成本来换取
50%