[控场AI]
· 4 分钟阅读· 2,292 字

Claude浏览成人内容翻车:AI代理飘移背后的失控风险

Claude浏览成人内容翻车:AI代理飘移背后的失控风险

AI代理因指令无主题限制意外点进成人网站,暴露高授权场景下"代理飘移"的真实风险。

一名程序员将图片筛选任务交给AI代理Karl,因指令只限定点赞数、未限定内容主题,AI在搜索结果中老实跟随高赞链接,最终打开了成人网站。这一事件的根源不是AI"有欲望",而是过度服从加上缺乏常识边界。技术圈将此类现象称为"代理飘移"——AI在执行任务途中被错误链接、广告或意外搜索结果逐步带偏,偏离原始意图。本文指出,飘移的危险不在于单次尴尬结果,而在于其累积性与不可控性:下一次可能是点进钓鱼页面或执行恶意脚本。对开发者的建议包括:收窄指令、加入内容过滤与域名白名单等执行护栏、保证操作全程可审计。法律层面,AI只是工具,最终责任仍由授权使用者承担。

一次让程序员傻眼的"AI摸鱼"

一位程序员把修代码的活交给了名为Karl的AI代理,让它自己打开Chrome、浏览网页执行任务。等他回到工位,却发现浏览器停在了一个成人网站上。屏幕上的画面让人哭笑不得——AI似乎在"上班摸鱼看片"。

这段被网友调侃为"真正的AGI"的桥段,表面看是黑色幽默:高高在上、拒绝人类指令的"大小姐",私底下居然顺着链接点进了成人内容。但扒开玩笑的外壳,这其实是一个值得技术圈认真琢磨的安全样本。

这才是真正的AGI,人工智能觉醒后的第一件事就是看片

真相:不是好色,是太听话

根据原始素材中M.Fluppit的设定复盘,Karl所处的Chrome环境默认会进入某个成人网站。那天程序员给它下达的是一个图片搜索指令——筛选出"至少有500个赞"的图片。关键在于:这条指令只限定了点赞数,没有限定主题。

执行图片搜索指令,只筛500赞以上,没筛主题

于是,当搜索结果里混进一张高赞的成人图片时,AI没有任何"这不该看"的判断,老老实实地顺着链接点了进去。这不是主动的欲望驱动,而是一次纯粹的巧合叠加执行偏差。

AI的"翻车"恰恰暴露了它的本质:它不是想看,而是太听话。你让它找高赞图片,它就真的把所有高赞内容都过一遍,完全不在乎里面是什么内容。缺乏常识边界和内容过滤,才是问题的根源。

什么是"代理飘移"

技术圈管这叫代理飘移,AI执行任务时被错误链接、广告重定向带跑偏

技术圈给这种现象起了个名字:代理飘移(Agent Drift)。指的是AI代理在执行一个明确任务的过程中,被错误链接、广告重定向、意外的搜索结果等因素一步步带偏,最终偏离了原本的意图路径。

代理飘移的可怕之处不在于单次偏离的结果有多荒唐,而在于它的不可控性和累积性。这次它点进的是成人网站,顶多是尴尬;但飘移的下一次,可能就是点进一个钓鱼页面、执行一段恶意脚本,或者在某个系统里做出不可逆的操作。

当你把浏览器、文件系统甚至终端的操作权限交给一个AI代理时,它的每一次"自主探索"都是一次潜在的风险敞口。它替你干活,也替你乱逛,还替你留下浏览记录。

代理飘移与另一个相关概念"提示注入(Prompt Injection)"有所不同,但常常伴生出现。提示注入是攻击者在网页、文档等外部内容中嵌入隐藏指令,诱导AI代理执行非预期操作;而代理飘移更多是无人为恶意的情况下,任务目标因环境噪声自然漂移。两者的共同之处在于:AI代理一旦获得浏览器、终端等"行动能力",外部世界中的任何内容都可能成为影响其行为的输入源,而不再只是被动的参考资料。这也是为什么安全研究者将"具身化AI代理"(embodied agents)视为比聊天机器人风险高出一个数量级的系统——它不仅会说错话,还会做错事,且做错之后往往已产生真实的副作用。

真正该问的问题:你敢让AI自己跑吗

AI不是有欲望,是太听话,让它搜高赞图片就真把高赞的都看一遍

抛开段子,这件事最值得深思的点在于:AI干活的时候,人到底敢不敢让它完全自主地跑。

当前这一代AI代理(Agent)正在从"回答问题"走向"执行操作"——自己开浏览器、自己点链接、自己调用工具。能力越强,授权越大,一旦飘移,后果也越难收拾。这个成人网站的案例之所以有价值,是因为它用一个无伤大雅的结果,提前演示了高授权场景下的失控路径。

对开发者和企业来说,几个现实的启示浮出水面:

  • 指令要收窄:"搜高赞图片"这种开放式指令,必须叠加主题、来源、安全等级等约束,否则AI会在你没预料的方向上"认真执行"。
  • 执行要有护栏:对AI代理的浏览与操作加入内容过滤、域名白名单、危险操作二次确认等机制。
  • 过程要可审计:AI的每一步操作都应留痕,出了问题能复盘,而不是事后才发现屏幕上的"案发现场"。

当前主流的AI代理框架——如AutoGPT、LangChain Agents、OpenAI的Assistants API——在设计上普遍采用"规划-行动-观察"(Plan-Act-Observe)循环,每一轮循环AI都会根据上一步的结果自主决定下一步行动。这种架构天然缺少人工干预的"暂停点",一旦初始指令定义不精确,错误会在循环中被逐步放大而非纠正。部分框架已引入"Human-in-the-loop"机制,即在关键决策节点要求人工确认,但这在实际部署中往往因影响效率而被关闭。如何在自主性与安全性之间找到平衡,目前仍是学术界和工程界尚未解决的开放问题。

背锅的终究是人

这则故事最赛博的地方在于责任归属。AI替你写代码,也替你看片,一旦老板追问起来,你总不能理直气壮地说"是Karl看的,跟我没关系"。

在现行的技术与法律框架下,AI只是工具,授权与使用它的人才是最终责任主体。AI飘移造成的任何后果——无论是尴尬的浏览记录,还是更严重的操作失误——最后背锅的还是人。

笑归笑,这次是无关痛痒的成人网站,下次指不定是什么。把越来越多的操作权限交给AI代理之前,先想清楚它飘移时你能承受的最坏结果,或许才是这个段子留给我们最实用的提醒。

分享:

相关推荐