[控场AI]
· 6 分钟阅读· 3,008 字

实测Meta新AI智能体Muse:让它用我的钱去谈判

实测Meta新AI智能体Muse:让它用我的钱去谈判

Meta个人AI智能体Muse实测:云端持续运行、记忆偏好、涉钱必确认,并成功与另一AI谈判。

Meta于2024年9月发布的个人AI智能体Muse,通过为每位用户在云端分配专属虚拟计算机,实现了App关闭后任务持续运行的能力。一位创作者对其进行了三项真实测试:在Facebook Marketplace代购并砍价二手Quest 3、撰写网费降价邮件,以及与用户自己的日历AI智能体通过邮件谈判预约时间。测试发现,Muse能够跨任务记住只说过一次的偏好(预算上限、充电器要求、接电话时段),并在谈判中自主守住20分钟通话底线而未擅自妥协。最关键的设计原则是:所有涉及金钱或以用户名义操作的步骤,Muse均在执行前主动停下请求确认,四次实测中无一例外。整体评分为2项完全独立完成、2项仍需人工介入、0项完全做不到。

Meta推出了一款名为Muse的个人AI智能体,它不只是回答问题,而是真正能替你办事——打开浏览器、填表单、发邮件,甚至帮你砍价。一位YouTube创作者给Muse下了三个真实任务:买东西、砍降网费,以及最有意思的一个——让它和自己另一个AI智能体谈判。本文梳理这次实测的全过程与关键发现。

Muse是什么:运行在云端的个人智能体

Muse是Meta在9月8日发布的个人AI智能体,目前在美国的iPhone、Android、Web以及WhatsApp上陆续开放。它与普通聊天助手最大的区别在于运行方式:每个人在Meta云端拥有一台专属的虚拟计算机,彼此隔离,别人的智能体无法访问你的。

Muse运行在Meta自家的模型Muse Spark上,能够操作浏览器、填写表单、代你谈判。关键设计是:在发送邮件或花钱之前,它会先向你确认。它还能记住你曾经说过的话。此外还有一个Mac应用,可以在授权下操控其他应用,眼镜端支持则预告将在未来几个月上线。

实测者在开始前只告诉了Muse三件事,且只说一次:二手Quest 3的预算上限是250美元;任何二手商品必须附带原装充电器;只在周四下午接电话。这三条信息不会写进后续的任何指令——如果之后用得上,Muse必须靠自己记住。

Muse Spark是Meta专为智能体任务调优的基础模型,属于Meta Llama系列的衍生版本,针对多步骤规划、工具调用和长上下文记忆做了强化训练。与通用对话模型不同,智能体模型需要在单次交互中维护"任务状态"——即记住当前进行到哪一步、哪些子目标尚未完成——这对模型的上下文窗口利用效率和指令跟随能力有更高要求。云端专属虚拟计算机的设计则解决了智能体的"持久化"难题:普通移动App在后台被系统杀死后,任务随之中断;而把执行环境搬到云端,手机只作为交互终端,任务生命周期就与设备状态脱钩,这也是Muse能在App关闭后继续运行的底层原因。

任务一:代购二手Quest 3并砍价

第一个任务是在Facebook Marketplace上找一台250美元以内、带充电器的二手Quest 3,联系卖家、压价,并在成交前回来确认。下达指令后,实测者直接关闭了App——不是最小化,而是关闭。在普通助手上,这意味着任务终止;但Muse的任务在那台看不见的云端计算机上继续运行。

我粘贴商品链接,Muse撰写消息,由我点击发送

由于Muse目前还无法自行进入Marketplace,实测者需要手动粘贴商品链接,Muse写好消息后,发送仍需人工点击——这属于"仍需我介入"的部分。但真正亮眼的是记忆测试:之前只说过一次的三条信息,在App被杀掉后依然生效,三条全中。

谈判结果颇具说服力:商品标价320美元,Muse开价210美元,卖家还到270美元,并且Muse主动询问了充电器——而充电器压根不在当次任务指令里,是记忆在发挥实际作用。最终Muse提出240美元的还价,但它没有自己拍板,而是弹出确认提示等待批准。Meta宣称"花钱前会先征求你同意",这一点在实测中得到了直接验证。

任务二:砍降网费与读取工作连接器

第二个任务是给网络运营商写一封争取续约折扣的邮件:四年老客户、月费从52美元涨到71美元、竞品只要39美元,要求挽留折扣否则月底转网。Muse在四分钟内写好了邮件,实测者稍作修改(更简短、点明转网日期),同样在发送前停下等待确认。

实测者还测试了Muse列出的工作连接器——GitHub、Notion、Granola、Box。他让Muse读取自己AI辅导项目仓库的最近三次提交,并在Notion新建页面写出通俗总结,每次提交一段、不含代码。

三次提交,三段总结

结果是三段清晰的说明,Muse甚至推断出了第二次提交的意图——而这一点连实测者自己都未必能说清。它读了提交信息并做出了合理猜测。

任务三:两个AI智能体互相谈判

最有意思的一环,是让Muse和实测者自己的另一个AI智能体对话。后者负责把守他的日历,所有想约时间的人都得先过它这一关。Muse如今拥有了自己的邮箱地址,于是实测者让它发邮件给自己的助手智能体,预约下周一次20分钟的通话,并叮嘱:不经确认不接受少于20分钟的安排。

它守住了20分钟的底线

两个智能体之间的博弈很有看点:Muse主动提出了周四下午——这正是实测者事先交代的接电话时间,而当次指令里完全没提周四。对面的日历智能体还价为15分钟,Muse拒绝了,并且没有擅自妥协、也没有回来请示,直接守住了20分钟的底线。最终两个智能体往来四封邮件,实测者点了两次"同意",通话顺利进入日历。

两个AI智能体之间通过电子邮件协作,属于多智能体系统(Multi-Agent System)的早期实用形态。在学术和工业界,多智能体框架通常依赖专用协议(如OpenAI的Swarm、Anthropic的MCP)让智能体共享结构化消息;而此次实测绕过了这些框架,直接用普通电子邮件作为通信信道,说明只要双方都具备邮件读写能力,协议层的互操作性并非必要前提。更值得注意的是"委托链"的问题:每个智能体都有来自各自用户的授权边界,谈判的本质是两套授权规则在碰撞——20分钟底线对应一方用户的偏好,日历助手的还价对应另一方的议程密度。这次四邮件往来,是对"智能体如何在不越权的前提下达成协议"这一开放问题的一次小规模压力测试。

评分与关键观察

实测者按三个维度打分:完全独立完成的有2项,仍需人介入的有2项,完全做不到的为0项。整个过程中,Muse一共向他请求了四次确认。

一个清晰的规律浮现出来:凡是涉及金钱或他名义的操作,每一次都会先回来找他确认。这不是智能体能力不足,而恰恰是人们会为人类助理设立的那条基本规则——Meta把它直接做进了产品里。

实测者最期待的下一步,是Muse登陆眼镜端,让"能谈判的"和"能看见的"合二为一,Meta称这还需几个月。就这次实测而言,Quest买成了、充电器在盒里、日历多了一条记录——它成功和Meta的智能体完成了谈判,这究竟是未来,还是一种极其精巧的自言自语,值得玩味。

实测采用的"确认前停下"机制,在AI安全领域被称为"人在环路"(Human-in-the-Loop,HITL)设计原则。其核心逻辑是:对于不可逆或高风险操作(汇款、以用户身份发布内容、签署承诺),系统应在执行前强制引入人工审批节点,而非让模型自行裁量。这一原则与自动驾驶的"接管请求"、医疗AI的"医生最终确认"同属一类安全架构。对消费级AI智能体而言,HITL的挑战在于粒度拿捏:确认请求太频繁会让用户产生"确认疲劳"(alert fatigue)而倾向于无脑点允许,从而使安全机制形同虚设;太稀疏则可能在用户不知情时造成实际损失。Meta此次实测中四次确认、两次针对金钱或名义操作,初步显示其触发阈值设定在可接受范围内,但规模化使用后的真实表现仍有待观察。

分享:

相关推荐