[控场AI]
· 8 分钟阅读· 4,132 字

Jev与TypeSafe:让AI真正可靠地执行软件意图

Jev与TypeSafe:让AI真正可靠地执行软件意图

Jev将AI智能嵌入软件内部状态机,以可靠性为核心让「应被自动化的任务」真正可自动化。

TypeSafe创始人Diogo在一场投资人对话中,直指AI领域最大的结构性矛盾:模型智能已极度先进,但企业内部真正被自动化的工作场景却少得可怜。他认为根源在于AI智能与软件自动化长期脱节——现有编程AI工具只是让程序员写得更快,软件本身并未变得更智能。Jev试图填补这一鸿沟:它作为一种新的编程原语,允许开发者用自然语言描述意图、结合状态机,在代码内部注入带置信度的智能决策。可靠性是其核心护城河,Diogo将其拆解为确定性与鲁棒性两个维度,主张每提升一个「9」就能解锁全新应用场景。SaaS公司对此普遍欢迎,Diogo判断这一波AI浪潮的最大受益者恰恰是SaaS而非颠覆者,而Jev的终极愿景是让技术真正「do what I mean」。

「所有的自动化到底在哪里?」

在这场由投资人与TypeSafe创始人Diogo的对话中,一句略带愤怒的开场定下了全篇基调:「所有的自动化到底跑哪去了?」AI已经聪明到令人难以置信,却在真正的工作场景中几乎毫无用处。Diogo并不否认ChatGPT、Claude Code、Codex这些工具的价值,相反他本人也是重度用户,但他尖锐地指出一个被大多数人忽视的事实——AI的智能和软件自动化之间,长期以来是「夜航中擦肩而过的两艘船」(ships in the night)。

OpenAI从2020年就开始尝试自动化客服,财务激励巨大,技术也早已就绪,但到今天企业内部真正被自动化的工作少得可怜,除了编程之外几乎没有成功的案例。Diogo把这种「理想与现实的严重错位」形容为「tragic(悲剧性的)」——我们手握大量「未经打磨的璞玉」,却只能在软件边上挂一个有时能动、有时不敢让它动的小聊天框。

you speak like an ai researcher you still speak like a systems person

Jev不是更快的程序员,而是「更聪明的软件」

要理解Jev的差异,关键在于区分两种思路。Diogo引用Gary Tan对Claude Code和Codex的评价——它们是「即时编译的软件(just-in-time software)」,能用自然语言在飞行中生成代码,但生成出来的东西和十年前的代码本质上没有区别。「不管用多少AI编程助手,软件本身并没有变好,你只是写得更快了,」他说,「甚至可能变得更糟,因为监督更少、往往更不安全。」

Jev走的是另一条路:不是用一个更快但未必更好的程序员去替代工程师,而是扩展软件本身能做的事情,让那些「本应该可被自动化」的任务真正变得可自动化。Diogo把它描述为一种全新的编程原语(primitive)——像一个库,你用自然语言描述意图,给它一个状态机(state machine),它就会在软件内部做出带有置信度的决策。无论调用它的是Claude Code还是人类,这个原语都给代码注入了一层此前不存在的「智能」。

他特别点出一个有意思的设计细节:Jev把输入称为「state(状态)」是刻意为之,意在表达它处理的是程序内部状态的智能编排,而不仅仅是「语言进、语言出」。

getting this electric motor of ai into people's workstations

**状态机(State Machine)**是一种经典的计算机科学抽象,描述系统在有限个状态之间按规则转换的行为——例如一个订单系统可能处于「待支付→已支付→已发货→已完成」等离散状态。传统状态机的转换规则是硬编码的确定性逻辑;Jev的创新在于将转换决策本身交给语言模型来判断,让系统能根据自然语言描述的「当前状态」智能选择下一步走向,而不是靠程序员预写每一条分支。这种设计使得原本需要大量if-else或规则引擎才能处理的模糊业务逻辑,变成可以用意图描述来驱动的动态流程。Diogo特意用「state」而非「input」来命名输入,正是为了强调Jev操作的是程序内部的业务状态语义,而非单纯做文本变换。

「Jev就是个分类器」——这恰恰是重点

面对「Jev不就是个分类器吗」的质疑,Diogo毫不回避:「Jev绝对是个分类器,而分类器超棒。」在团队的入职第一天,他会画一个维恩图:AI擅长什么、代码里什么有价值,Jev就落在二者的交集中。所以它不会去输出AI本就不擅长的外推浮点数,但会处理概率这类「并不新鲜却极其实用」的概念。

他给出一个大胆判断:Jev很可能比2019年一支机器学习工程(MLE)团队为你定制的系统还要好用——过去搭这类系统需要收集数据集、做评估、调模型,门槛极高且团队稀缺,而现在你几乎可以「在飞行中编程」实现同样的能力。这背后是他的北极星指标:每美元智能(intelligence per dollar),而非短期更吸引眼球的「每秒智能」。

关于Jev在设计空间中的位置,Diogo坦言心里的答案是一个「滑块」:一端是今天的「语言进语言出」,另一端是传统的命令式程序,而Jev是「语言进、状态机出」,试图在这条光谱上为通用编程找到稳固的落点。

**每美元智能(Intelligence per Dollar)**这一指标的背后,是对当前AI落地经济学的一种务实重构。MLE(机器学习工程)团队在2019年前后是极度稀缺的资源:搭建一套生产级分类系统往往需要数月的数据标注、模型训练、A/B评估与基础设施维护,总成本轻易超过百万美元,且高度依赖难以招募的专业人才。大语言模型的出现使「零样本分类」成为可能,但API调用成本与推理延迟依然是规模化部署时的核心瓶颈。Diogo用「每美元智能」而非「每秒智能」作为北极星,是在说:对企业真正重要的不是模型跑得多快,而是在给定预算下能解锁多少原本无法自动化的业务决策——这也直接决定了Jev在定价与架构上的取舍方向。

可靠性,才是Jev真正的护城河

整场对话中,Diogo反复强调一个词:reliability(可靠性)。他说这款产品本可以更早发布,之所以压了多年,正是因为对可靠性的极致追求。他把可靠性拆成几个层次:第一层接近「正常运行时间/SLA」;第二层接近「确定性」(同样输入返回同样结果,适合单元测试但不完全适用于真实系统);第三层他称为「鲁棒性」——不要求每次函数完全一致,但要求每次都足够聪明。

他举了一个精妙的例子:如果给prompt加一个UUID,功能上理应得到相同结果;真实系统需要的不是机械的确定性,而是「每一次都智能」的稳定表现。可靠性的最高荣誉,是让开发者无需写示例查询就能信任它、直接针对它编程,进入「永久心流状态」去创造软件。

Diogo认为,每一个「9」的可靠性提升都会解锁全新的应用场景。他举了一个让人眼前一亮的例子:有人用语音控制电脑,Jev不断判断「这是一条命令,还是要插入的文本」——这类让交互界面彻底改变的应用,正是可靠性带来的。他同时诚实地表示,无法保证所有Demo都真的可靠,这正是他拒绝「过度承诺、低度交付(over-promise, under-deliver)」的态度。

the software actually isn't getting better. Maybe you're writing it faster

软件工程中常用「几个9」来衡量系统可用性:99%(两个9)意味着每年约87小时宕机,99.9%(三个9)约8.7小时,99.99%(四个9)约52分钟。对于传统确定性代码,测试与调试相对直接;但AI组件的「可靠性」远比这复杂——同一个prompt在不同上下文下可能产生不同输出,而这种不一致性在自动化流程中会被放大成级联故障。Diogo区分「确定性」与「鲁棒性」正是直面这一困境:纯粹的确定性对LLM来说既不现实也未必必要,真正需要的是每次调用都能达到「足够好」的决策质量下限,使得开发者可以像信任标准库函数一样信任它、直接围绕它构建系统,而无需在每个调用点都加防御性检查。

从「SaaS末日」到「SaaS狂欢」

市场给出了一个耐人寻味的信号。编程智能体刚出现时,业界喊出「SaaS末日论(SaaSpocalypse)」,SaaS公司估值集体跳水;而Jev一出,SaaS公司却纷纷表示「这是史上最棒的东西」。Diogo对此的解读是:SaaS末日论建立在「软件既便宜又易于复制」的前提上,前者或许成立,后者则大错特错——大量价值藏在引擎盖之下,难以复制。

他判断SaaS反而会是整个AI浪潮最大的赢家之一。因为SaaS公司最懂用户的真实工作流、最清楚该自动化什么,而且早已完成了触达海量客户的巨额资本投入。当它们不只是在产品旁挂一个聊天框,而是用Jev让软件本身变得「极大地更有用」,就会迎来一场「反向SaaS末日」。他甚至畅想,多选表单这类东西可能彻底消失——它们本质上只是把软件早已拥有的能力,强行映射成一种「人工语言」。

一位把AI当成程序员工具的「务实主义者」

Diogo的背景颇为非典型。他自称曾是获奖数学竞赛选手,却坦言「从没真正喜欢过数学」,转向计算机科学后才找到乐趣——「计算机科学就像数学,但更酷、更有用、更有趣」。真正把他带入AI圈的是一次Kaggle竞赛夺冠,靠的不是精巧数学而是「疯狂地自动化、嵌套循环解决系统问题」。此后他与Jeremy Howard共事、在Google Brain工作、短暂退休,最终因为「AI实在太好玩了」而加入OpenAI。

他对AI的态度与多数大厂领袖截然不同。他推崇TypeSafe那句「我们造的是prod,不是God(we build prod, not God)」,明确表示自己「出于诸多细致的理由,不认为我们正走在RSI(递归自我改进)的道路上」。在他看来,业界的悲观叙事源于一种「单一大模型的迷魂汤」——相信要造一个统治一切的大脑。而他真正相信的,是让所有技术都「做我想做的事(do what I mean)」,让世界像咬合的齿轮一样更顺滑地运转。

对于编程智能体,他给出了务实评价:它们擅长语法、也懂一些语义,但在架构上「极其糟糕」——而架构恰恰是软件中最具人类创造力的部分。或许模型的架构能力只是「第50百分位」,对不懂架构的人已经够用,这就成了速度与质量之间的灰色权衡。最终他把Jev定位为一种值得「重新构建系统」的新原语——就像互联网、客户端-服务器架构曾经带来的那种周期性重构,而「do what I mean」正是这一切的核心愿景。

分享:

相关推荐