Ballet:用代码固化AI工作流,每次执行都给出确定结果

当Agentic工作流遇上"确定性"难题
近年来,AI Agent(智能体)成为自动化领域最炙手可热的概念。人们期待用自然语言描述任务,让AI自动执行——从数据处理到跨系统操作,无所不能。然而,理想很丰满,现实却常常令人头疼:同样的指令,AI每次给出的结果都可能不同。这种不确定性对于严肃的商业运营场景来说,几乎是致命的。
这背后有一个关键的技术原因:大语言模型(LLM)在生成文本时依赖一个名为"temperature"的参数来控制输出的随机性。Temperature参数本质上是对softmax函数输出的logits进行缩放——当temperature=1时,保持原始概率分布;当temperature>1时,分布更平坦,低概率token被选中的几率增加,产生更多样化但不可预测的输出;当temperature<1时,分布更尖锐,模型更倾向选择最高概率的token。即使将temperature设为0(贪婪解码),由于GPU浮点运算的非确定性(不同batch的矩阵乘法顺序可能不同)、模型量化误差、不同硬件架构的计算精度差异,以及top-k/top-p采样策略的影响,同一输入仍可能产生细微不同的输出。这就是为什么传统AI Agent在每次执行时都会产生不同结果——它们本质上是在每次调用时重新进行一次概率推理。
近日在 Product Hunt 上亮相的新产品 Ballet,正是瞄准了这一痛点。它的口号简洁而直击要害——"Agentic workflows that deliver the same outcome every time"(每次都能交付相同结果的智能体工作流)。凭借这一定位,Ballet 上线后获得了 96 个赞,跻身当日榜单第 15 位。

Ballet到底解决了什么问题
从"用自然语言描述"到"用代码执行"
Ballet 的核心工作方式是:运营团队用纯自然语言(plain English)描述一个工作流,Ballet 则将其转化为代码并运行。
这一设计的巧妙之处在于中间层的"代码化"。传统的 AI Agent 往往在每次执行时都依赖大模型的即时推理,这正是结果不稳定的根源——大模型本身具有随机性。而 Ballet 把 Agent 生成的逻辑固化为可审查、可复现的代码,一旦确定,后续运行便遵循同一套确定性逻辑。
从技术角度看,Ballet所采用的"自然语言→代码→执行"架构,在学术界被称为Program Synthesis(程序合成)或Code Generation范式。程序合成是计算机科学中一个有着数十年历史的研究方向,其目标是从高层规格说明自动生成程序。早期方法依赖形式化规范和定理证明,而现代方法借助LLM实现了从自然语言到代码的直接转换。GitHub Copilot、Amazon CodeWhisperer等工具已在开发者层面验证了这一范式的可行性。
其核心思想是将LLM的角色从"执行者"转变为"编译器"——AI只在初始阶段参与逻辑生成,一旦代码被确认,后续执行完全脱离大模型的概率推理,转而由确定性的代码运行时来保障。这种模式也被称为"LLM-as-Compiler"模式,与之对应的是"LLM-as-Runtime"模式(即每次执行都调用大模型),后者正是不确定性的主要来源。Ballet的创新在于将这一范式从开发者工具延伸到业务运营层面,让非技术人员也能通过自然语言触发程序合成过程。
这就把"每次靠AI临场发挥"变成了"一次生成、稳定复用",从而实现了官方宣称的"same outcome every time"。
面向运营团队,而非开发者
有意思的是,Ballet 的目标用户是运营团队(operations teams),而不是传统意义上的程序员。它承诺让这些团队"在几分钟内自动化他们最棘手的业务难题"。
这意味着 Ballet 试图降低自动化的门槛:不懂代码的业务人员,也能通过描述需求让系统自动生成并运行程序。虽然产品被归类到 Developer Tools(开发者工具),但其真正的价值主张是让非技术人员也能享受到代码级自动化的可靠性。
四大特性构筑"可信自动化"
Ballet 之所以敢承诺"确定性",除了代码化的底层逻辑,还配套了一系列面向企业级可信度的功能:
完整审计日志(Full Audit Log)
每一次工作流的执行都有完整记录。对于金融、合规、供应链等对可追溯性要求极高的场景,审计日志是刚需——出了问题能查到根源,也便于满足监管要求。
完整审计日志(Audit Trail)在受监管行业中具有法律层面的刚性需求。例如,SOX法案(萨班斯-奥克斯利法案)要求上市公司对财务相关的信息系统操作保留完整记录;GDPR则要求企业能够追溯个人数据的每一次处理行为;HIPAA在医疗领域要求所有涉及患者信息的系统访问都必须被记录和审计。当AI Agent被引入这些场景时,如果无法提供完整的执行记录——包括输入数据、决策逻辑、输出结果和时间戳——企业将面临合规风险甚至法律处罚。传统RPA工具如UiPath、Automation Anywhere早已将审计日志作为标配功能,Ballet将这一企业级要求引入Agentic工作流,是其走向生产环境的必要条件。
一键回滚(One-Click Rollback)
自动化最大的风险之一是"错误被批量放大"。一旦某个环节出错,可能瞬间波及大量数据或操作。Ballet 提供一键回滚能力,让团队在出错时能够快速撤销变更,把损失控制在最小范围。
回滚(Rollback)概念源自数据库事务管理中的ACID原则——特别是原子性(Atomicity)要求:一组操作要么全部成功,要么全部撤销。在跨系统的自动化场景中,实现回滚远比单一数据库复杂得多。在微服务架构下,一个业务操作通常跨越多个服务和数据库,传统的两阶段提交(2PC)由于性能开销和单点故障问题而不再适用。Saga模式将长事务分解为一系列本地事务,每个本地事务对应一个补偿操作(Compensating Transaction)。当某个步骤失败时,系统按反向顺序执行前序步骤的补偿操作以恢复一致性。
例如,一个工作流可能同时涉及CRM系统的客户记录更新、ERP系统的库存调整和邮件系统的通知发送。如果CRM和ERP步骤成功但邮件发送失败,补偿事务会将CRM记录还原到修改前的状态并撤销ERP的库存调整。这要求系统在每一步都记录足够的上下文信息以支持逆向操作。Ballet提供一键回滚意味着它需要在底层维护完整的操作日志和对应的逆向操作定义,这对于涉及外部API调用和不可逆操作(如已发送的邮件、已提交的支付)的场景提出了相当高的工程要求。
模拟模式(Simulation Mode)
在真正执行前,用户可以先在模拟模式下预演工作流,观察 AI 将会做什么、产生什么结果。这相当于给自动化流程加了一道"试跑"保险,避免直接在生产环境中试错。
模拟模式的理念在软件工程中并不陌生。在DevOps领域,Shadow Deployment(影子部署)或Dark Launch(暗发布)是一种成熟实践——新版本在生产环境中接收真实流量但不产生实际影响,团队可以对比新旧版本的输出差异。在金融交易领域,Paper Trading(模拟交易)让交易员在真实市场数据下测试策略而不涉及实际资金。在航空航天领域,数字孪生(Digital Twin)技术让工程师能够在虚拟环境中模拟复杂系统的行为。
Ballet将这一思路引入AI Agent执行层,本质上是为自动化工作流提供了一个沙盒环境(Sandbox),让用户能够在不承担后果的情况下验证AI生成的逻辑是否符合预期。这对于建立用户对AI自动化的信任尤为重要——用户可以反复观察模拟结果,确认无误后再切换到生产模式执行。
权限可控(You Choose How Much It Can Do)
Ballet 让用户自主决定授予 Agent 多大的操作权限。你可以让它只做只读的分析,也可以逐步放开写入、执行等更高权限。这种渐进式授权机制,契合了当前业界对 AI Agent 安全边界的普遍关切。
这一机制体现了AI安全领域的"最小权限原则"(Principle of Least Privilege)。该原则最早由Jerome Saltzer在1975年提出,要求系统中的每个模块只能访问完成其工作所必需的资源。在AI Agent语境下,这一原则尤为重要,因为Agent具有自主决策能力——与传统软件不同,Agent可能在运行时决定执行预期之外的操作。
2024年以来,随着AI Agent能力的快速增长,行业对Agent安全边界的讨论日趋激烈。Anthropic提出了"Constitutional AI"框架来约束模型行为;OpenAI在其Agent产品中引入了"human-in-the-loop"(人在回路中)机制;Google DeepMind则发表了关于Agent对齐(Agent Alignment)的研究论文。多起AI Agent安全事件(如Agent被prompt injection攻击后执行未授权操作)凸显了权限控制的紧迫性。核心共识是:AI Agent的权限应当是渐进式的、可撤销的,而非一次性全部授予。这与传统IT安全中的Zero Trust(零信任)架构理念一脉相承——不默认信任任何实体,每次操作都需要验证授权。渐进式授权不仅是安全措施,也是建立人机信任的心理学基础——用户需要在小范围内验证Agent的可靠性后,才愿意逐步扩大其权限边界。
为什么"确定性"是Agent落地的关键
从行业视角看,Ballet 的产品思路折射出 AI Agent 商业化的一条重要路径。
过去一年,市面上涌现了大量号称"全自动"的 Agent 产品,演示视频往往惊艳,但真正投入企业生产环境时,却因为结果不可预测、缺乏审计、难以纠错而难以规模化。企业运营讲究的是流程的稳定与可控,而非每次都充满惊喜(或惊吓)的AI输出。
Ballet 的做法——用自然语言降低门槛,用代码保证确定性,用审计、回滚、模拟、权限控制来构筑信任——实际上是在"AI的灵活性"与"企业的可靠性需求"之间寻找平衡点。这也代表了 Agentic 产品从"炫技"走向"实用"的一个成熟方向。
值得注意的是,Ballet的出现正处于自动化产业演进的关键节点上。第一代企业自动化以RPA(机器人流程自动化)为代表,通过预定义的规则和脚本执行重复性任务,代表厂商包括UiPath(估值曾超350亿美元)、Automation Anywhere和Blue Prism。RPA市场在2019-2022年经历了爆发式增长,全球市场规模从约15亿美元增长到超过60亿美元。但RPA的局限性也日益明显:它只能处理结构化、规则明确的流程,面对非结构化数据(如邮件内容解析、文档理解)或需要判断力的场景则力不从心。RPA的优势是确定性极高,但缺点是灵活性差——任何流程变化都需要人工修改脚本。
第二代则是纯LLM驱动的AI Agent,灵活性极高但确定性不足。Ballet试图开辟的是"第三条路"——结合LLM的自然语言理解能力与代码执行的确定性,可以被视为Agentic RPA或Intelligent Process Automation(IPA)的进化形态。IPA结合了RPA的确定性执行引擎与AI的认知能力,包括NLP、计算机视觉和决策引擎。McKinsey估计IPA可以将RPA的适用范围从约30%的企业任务扩展到50-70%。Gartner在2024年的报告中预测,到2027年,超过40%的现有RPA任务将被AI增强的自动化工具取代。Ballet的"自然语言→代码→确定性执行"模式正是IPA理念的一种具体实现路径。
确定性可能是下一个竞争高地
Ballet 目前仍处于早期阶段,96 票的成绩虽不算爆款,但其定位精准地击中了企业自动化的核心焦虑。当越来越多的团队开始把 AI Agent 引入真实业务流程时,"每次都靠谱"或许会比"什么都能做"更有说服力。
对于关注 AI 自动化的团队而言,Ballet 提供了一个值得参考的范式:真正能在企业落地的智能体,不仅要聪明,更要可预测、可审计、可控制。这可能正是 Agentic 工作流走向大规模应用必须跨过的门槛。
核心要点
相关推荐

Gemini Skills BETA测试解析:AI技能化平台如何改变你的工作流
Google Gemini Skills进入BETA测试阶段,将AI从通用对话助手升级为可插拔的技能平台。本文解析技能化趋势、社区热门技能方向及对开发者和普通用户的实际影响。

走出教程地狱:从看视频到读文档论文的深度学习方法
一位机器学习自学者分享如何摆脱教程地狱,从被动看YouTube视频转向主动读文档和论文。通过动手实践、故意破坏代码再修复的方法,真正掌握CNN、Transformer等AI架构的学习经验总结。

RightCard:无需银行登录的信用卡返现优化助手
RightCard是一款隐私优先的iOS信用卡助手,无需银行登录即可智能推荐最优返现卡片、自动激活银行优惠、提醒年费权益。本地计算零数据上传,适合持有多张美国信用卡的用户。