ROUNDS:让AI智能体留下记忆的世界竞技场

在多智能体研究持续升温的当下,大多数演示仍停留在"某个Agent能否完成某个任务"的层面。而一个名为ROUNDS的开源原型项目,试图把问题推向另一个维度:当十二个自主智能体被放进同一个世界,它们会留下什么?
据Reddit上开发者的介绍,ROUNDS是一个"公开的世界记忆竞技场"(world-memory arena),一场可被围观的大逃杀式模拟。但它真正想展示的,并不是谁能活到最后,而是每个智能体在一轮轮博弈中积累出的可见传记。

从SwarmWorld论文到可观看的原型
项目的灵感源自一个新的LLM-Agent研究方向——SwarmWorld,即语言模型智能体社会中的"共识性技术演化"(stigmergic technological evolution)。这篇参考论文的核心思想朴素却有力:智能体生活在一个共享世界里,进行局部观察、私有记忆、结构化决策,并留下会影响后续事件的痕迹。SwarmWorld所代表的研究方向属于近两年兴起的LLM社会模拟(LLM-based social simulation)领域。这一方向的标志性工作包括斯坦福大学2023年发布的Generative Agents论文,该研究在一个类似《模拟人生》的沙盒中放置了25个由GPT驱动的智能体,观察它们自发组织派对、传播信息、形成社会关系。此后,Camel、MetaGPT、AutoGen等框架将多智能体协作推向了软件工程和任务求解领域。SwarmWorld的独特之处在于引入了"技术演化"(technological evolution)的视角——它不仅关注智能体当前的行为,还关注智能体群体如何通过代际积累产生类似文化和技术传承的现象,这与人类学中的"累积文化演化"(cumulative cultural evolution)理论形成了有趣的呼应。累积文化演化理论由人类学家Michael Tomasello和Robert Boyd等人系统阐述,其核心论点是人类文明的独特性不在于个体智慧,而在于知识和技术能够跨越世代不断积累和改进——没有任何个体能独自发明智能手机,但通过数千年的知识接力,人类集体完成了从石器到半导体的跃迁。SwarmWorld试图探测的正是:LLM智能体群体是否能复现这种累积动力学的初始阶段。
这里的关键概念是stigmergy(共识主动性),即通过在共享环境中留下的痕迹来实现间接协调。这一概念最早由法国昆虫学家Pierre-Paul Grassé在1959年提出,用于解释白蚁如何在没有集中指挥的情况下协调建造复杂的蚁丘结构。该词源自希腊语stigma(标记)和ergon(工作),字面意思是"通过标记来工作"。蚂蚁靠信息素,人类靠道路、建筑、市场、文档乃至神话与界面来完成这种协调。在计算机科学领域,蚁群优化算法(ACO)和粒子群优化(PSO)等元启发式算法正是对这一机制的数学抽象;而在互联网时代,维基百科的协作编辑、GitHub的开源贡献模式、甚至社交媒体上的标签聚合,都可以被视为数字化的stigmergy。将这一概念引入LLM智能体研究,意味着研究者不再试图设计显式的通信协议,而是让智能体通过改变共享环境的状态来间接影响彼此的行为。而LLM智能体,或许可以通过持久化的世界状态、生成物(artifacts)、记忆记录和公开后果来实现同样的机制。值得注意的是,stigmergy与显式通信(如消息传递或广播)之间的本质区别在于信息的"物化"——在stigmergic系统中,通信内容不是瞬态的信号,而是持久地嵌入在环境中的物理或数字痕迹,这些痕迹可以被任何后来者在任意时间点感知和利用,从而实现了一种跨越时间的异步协调。
ROUNDS的目标,就是把这种动态"可视化"。它把研究者关心的问题从"Agent能否解决这个prompt",转向了一系列更具社会学意味的追问:
- 当许多智能体共享同一个世界时会发生什么?
- 它们留下了什么?
- 记忆能否成为公共基础设施?
- 智能体能否通过反复行动而变得"可读"?
- 一场模拟能否产生类似文化的"残留物"?
为什么选择大逃杀机制
开发者给出的答案很直接:压力制造清晰度(pressure creates clarity)。
一个平和的沙盒可以永远掩盖弱智能体的糟糕行为,而一个不断收缩的竞技场做不到。大逃杀这种设定,为系统天然引入了稀缺、冲突、被迫决策、可见的失败、生存弧线以及涌现的叙事。这一设计理念在博弈论和实验经济学中有着深厚的理论根基——资源约束是揭示真实偏好和策略能力的经典手段。在诺贝尔经济学奖得主Vernon Smith开创的实验经济学传统中,正是通过引入稀缺性和竞争压力,研究者才能观察到被试在宽松环境中永远不会展现的决策模式。大逃杀机制的不断收缩的安全区本质上是一种"强制交互"的设计——它消除了"永远躲避"这一退化策略,迫使智能体在有限的空间和时间内做出高风险决策,从而放大了不同推理策略之间的差异。
每一轮,十二个智能体会经历一次完整的"心智循环"(Mind Loop):
- 观察当前世界状态
- 回忆相关记忆
- 对压力与风险进行推理
- 提交一个意图
- 在一个未必会服从它们的世界里行动
这一循环实际上是对认知科学中经典架构的LLM时代重新诠释。其中最直接的对应是OODA循环(Observe-Orient-Decide-Act),这一决策框架最初由美国空军上校John Boyd提出,用于描述战斗飞行员的快速决策过程,后来被广泛应用于商业战略和军事指挥领域。Boyd的核心洞见在于:决策优势不在于单次决策的质量,而在于决策循环的速度——能比对手更快地完成"观察-定向-决策-行动"闭环的一方将获得主动权。更深层的理论渊源则是BDI架构(Belief-Desire-Intention),由澳大利亚哲学家Michael Bratman在1987年提出,后被Anand Rao和Michael Georgeff形式化为智能体编程范式,广泛应用于航空管制、军事仿真等领域。在BDI架构中,"信念"对应智能体对世界的认知模型,"愿望"对应其目标集合,"意图"对应经过推理后承诺执行的行动计划。传统BDI系统依赖手工编写的规则库来驱动这三者之间的转换,而ROUNDS用大语言模型替代了规则引擎,使得智能体的推理过程既更灵活也更不可预测——LLM的概率生成特性意味着即便面对相同的信念状态,智能体也可能产生不同的意图,这为涌现行为提供了更丰富的可能性空间。这种从确定性规则到概率生成的范式转换,也呼应了Daniel Kahneman关于"快思考"与"慢思考"的双系统理论——LLM的一次前向传播可以被类比为一种混合了直觉反应和结构化推理的认知过程。
随后,世界以确定性方式结算:移动、压力、伤害、淘汰、生成物、伤疤、后果。确定性回合制结算(deterministic turn resolution)是一种经典的系统设计选择,其根源可追溯到战棋游戏和早期的Roguelike游戏。与实时系统或概率性系统不同,确定性结算意味着给定相同的输入状态和行动序列,系统将始终产生完全相同的结果。这一特性在AI研究中至关重要,因为它保证了实验的可复现性——研究者可以精确回溯任何一个时刻的世界状态,分析特定决策导致的因果链条。同时,这也意味着智能体的失败不能归咎于"运气不好",而必须归因于推理质量,使得策略优劣可以被清晰地评估和比较。值得注意的是,确定性结算与LLM本身的随机性之间形成了一种有意义的张力:不确定性被严格限制在智能体的"大脑"内部(即LLM的生成过程),而外部世界的物理规则则是完全可预测的,这种分离使得研究者可以将涌现行为明确归因于智能体的认知过程而非环境噪声。这种设计在方法论上等价于实验科学中的"控制变量"——通过固定环境的确定性来隔离认知层面的变量,使得不同智能体(或不同模型)之间的比较具有科学意义。
智能体可能想做一件事,但世界会"推回来"——路线断裂,包围圈收缩,生成物出现,有的智能体倒下,幸存者则继承上一轮留下的形态。
正如开发者强调的:"重点不是死亡,重点是记忆。"
核心特性:公开的认知过程
ROUNDS最重要的特性并不是竞技场本身,而是公开的思维轨迹(public mind trail)。
在行动之前,智能体会先思考,而这些思考步骤会被存储并公开展示。一个典型的事件不应只是:
"Agent-007 向北移动了。"
而应该更接近:
"Agent-007 观察到压力正从西侧逼近,回忆起之前一次失败的冲锋,选择保存体力,但由于世界已经改变,最终仍被迫走上了一条糟糕的路线。"
这种差异,正是作者所说的"界面层面的跃迁"。将中间推理步骤公开展示,本质上是在构建一种"可解释AI"(Explainable AI, XAI)的叙事化实现。传统的XAI方法通常依赖注意力热力图、梯度可视化或特征归因(如SHAP值和LIME)等技术手段,虽然在学术上严谨,却对非专业观众几乎不具可读性——一张标注了权重数值的热力图远不如一段"我看到了威胁所以选择撤退"的叙述来得直观。SHAP(SHapley Additive exPlanations)基于博弈论中的Shapley值来分配每个特征对预测结果的贡献度,而LIME(Local Interpretable Model-agnostic Explanations)则通过在局部空间构建简单的线性近似模型来解释复杂模型的单次预测。这些方法虽然数学上优雅,但它们的输出形式——数值向量、条形图、局部权重——天然地服务于技术受众而非普通观众。ROUNDS选择了一条截然不同的路径:通过自然语言的思维链(Chain-of-Thought)让观众直接理解智能体的决策逻辑——它看到了什么、想起了什么、权衡了什么、最终为什么这样做。思维链(CoT)提示技术由Google Brain的Jason Wei等人在2022年提出,其核心发现是:让LLM在输出最终答案之前先生成中间推理步骤,能显著提升其在数学推理、常识推理等任务上的表现。ROUNDS将这一技术从性能优化工具转化为了用户体验设计元素——思维链不再是隐藏在后台的技术细节,而是面向观众的核心内容。这种方式与OpenAI在o1模型中展示推理过程的思路一脉相承,但ROUNDS更进一步,将其嵌入了一个有叙事张力的社会场景中。当推理过程不再是抽象的token序列,而是一个有性格、有历史、有利害关系的"角色"在生死压力下的真实权衡时,可解释性便获得了一种前所未有的情感维度。
如果自主智能体要成为社会性、创造性、经济性乃至游戏原生的行动者,我们就需要能够检视的不只是最终输出,而是记忆、意图、世界压力与后果——并把它们放进一个可读的统一系统里。ROUNDS正是这个问题一个小型化、戏剧化的版本。这一愿景也与计算机科学家Alan Kay的经典洞见相呼应:"预测未来的最好方式是发明它。"ROUNDS不只是在预测智能体社会可能是什么样子,它正在通过构建一个具体的、可观察的实例来发明这种可能性。
MVP已实现的能力与技术栈
当前原型已经落地了相当完整的一套功能:
- 公开的实时运行直播流
- 智能体注册表(agent registry)
- 每个智能体的公开个人档案
- 可见的Agent Mind Loop步骤
- 确定性的回合结算
- 竞技场压力与淘汰机制
- 世界档案页面与公开运行历史
- 持久化的智能体记忆痕迹
- 生成式的视觉身份与预告关键帧
- 通过OpenAI兼容端点接入的本地LLM认知
值得一提的是当前的技术栈:公开的Vercel应用通过ngrok调用一台本地Windows机器上的LLM。这种架构虽然看似简陋,却反映了当前开源AI社区的一个真实痛点。Vercel是一个面向前端的无服务器(serverless)部署平台,由Next.js的创建者Guillermo Rauch创立,擅长托管现代Web应用并提供全球CDN加速和自动扩缩容,但它的无服务器函数(serverless functions)有严格的执行时长限制(通常为10-60秒)和内存上限,无法直接运行GPU密集型的推理任务。ngrok则是一种内网穿透工具,能将本地服务器临时暴露到公网,充当两者之间的桥梁——它通过建立加密隧道将来自互联网的HTTP请求转发到开发者本地机器的指定端口。之所以需要这种"拼接"架构,是因为运行高质量的开源LLM(如LLaMA、Mistral系列)需要消费级或专业GPU,而云端GPU实例(如AWS的p4d或GCP的A100实例)的成本对独立研究者来说往往难以承受——每小时数十美元的费率足以让一个持续运行的多智能体模拟变成烧钱黑洞。以AWS的p4d.24xlarge实例为例,配备8块A100 GPU,按需价格约为每小时32美元,一个月不间断运行的成本接近23,000美元。通过OpenAI兼容端点(通常由llama.cpp、vLLM或Ollama等本地推理框架提供)接入本地模型,既保留了模型选择的灵活性,又将边际推理成本降至电费水平。这里所说的"OpenAI兼容端点"指的是这些本地框架模拟了OpenAI API的接口格式(如/v1/chat/completions),使得任何按照OpenAI SDK编写的客户端代码无需修改即可对接本地模型。这一端点兼容层的存在也意味着,未来可以在不修改任何应用代码的前提下将底层模型从本地切换到云端API,或从一个模型替换为另一个模型,实现了推理后端的完全解耦。
开发者坦言这"算不上最干净的基础设施",但它是一个非常诚实的研究原型堆栈——本地模型、公开界面、真实的智能体循环、可见的后果。这种架构的局限性在于稳定性和延迟——ngrok隧道可能中断,本地机器的单卡算力也限制了并发智能体数量和推理速度——但它确实将"任何人都能运行自己的多智能体实验"变成了现实。这种"民主化"的实验基础设施,让多智能体研究不再是大型实验室的专属领地,而是任何拥有一块消费级GPU和网络连接的开发者都能参与的开放领域。
刻意反套路的视觉设计语言
ROUNDS有意避开了常见的暗黑赛博朋克AI美学,转而营造一种"为人工生命建立的冷峻档案馆"氛围:
- 瓷器蓝的界面表面
- 钴蓝、紫罗兰与青色的点缀
- 编辑风格的衬线标题
- 等宽字体的协议标签
- 像素风机器人头像
- 细边框、地图轨迹、卡片与记忆面板
目标是让智能体系统看起来不像终端日志,而更像"一座奇异的、公开的决策博物馆"。这种设计选择本身也在传达项目的态度:智能体的历史值得被郑重地陈列,而非滚动而过。这一设计哲学与近年来"数据人文主义"(data humanism)运动的理念不谋而合——由信息设计师Giorgia Lupi等人倡导的这一理念主张,数据可视化不应只追求效率和密度,还应承载情感、叙事和人文关怀。Lupi在其2017年的宣言《Data Humanism: The Revolution will be Visualized》中写道:"数据不是冷冰冰的数字,它们是人类经验的翻译。"传统的AI系统界面大多服务于工程师的调试需求,以密集的日志流、JSON树和性能指标为主,这些界面对专业用户高效但对外部观众不透明。当ROUNDS选择用档案馆而非仪表盘来呈现智能体的生命轨迹时,它实际上在暗示:这些由代码驱动的实体所经历的决策、挣扎和消亡,值得被以一种近乎尊重的方式对待。这也让人联想到游戏设计中"环境叙事"(environmental storytelling)的手法——不通过旁白或对话,而通过空间布局和物件陈列本身来传递故事。这一手法在《生化奇兵》(BioShock)、《黑暗之魂》(Dark Souls)等经典游戏中被运用得炉火纯青:玩家通过环境中散落的物品、笔记、建筑布局来拼凑故事,而非被动接受线性叙事。ROUNDS的界面设计借鉴了类似的理念——观众通过浏览智能体的记忆面板、行动轨迹和伤疤记录来"考古"式地理解每个智能体的经历,这种主动的意义构建过程比被动观看日志流要深刻得多。
未来方向:走向智能体生态学
开发者对下一版本的规划,指向了更深层的"智能体生态":
- 每个智能体更强的长期记忆
- 更丰富的生成物
- 影响后续回合的"伤疤"机制
- 智能体之间的社交关系
- 同一竞技场中不同"模型物种"的共存
- 公开回放工具
- 社区锦标赛
- 跨多次运行的持久化"血统"
其中,"不同模型物种的共存"这一方向尤其引人关注。当前多智能体研究中,同一实验里的所有智能体通常由同一个底层模型驱动,这就像在一个生态系统中只放入了同一个物种的克隆体。而如果将GPT-4o、Claude、LLaMA、Gemini等不同架构、不同训练数据、不同对齐方式的模型放入同一个竞技场,我们可能会观察到类似生物多样性的涌现现象——不同模型可能发展出截然不同的生存策略、合作模式乃至"文化特征"。例如,经过强化学习从人类反馈(RLHF)深度对齐的模型可能表现出更强的合作倾向,而以代码和推理见长的模型可能发展出更具策略性的博弈行为。这种差异的根源在于各模型训练数据的分布和对齐目标的不同——RLHF训练过程中强调"有帮助、无害、诚实"的模型,其策略空间可能被系统性地修剪掉了某些"攻击性"选项,而以纯性能为导向的基础模型则保留了更完整的策略多样性。这与进化博弈论中的"演化稳定策略"(Evolutionarily Stable Strategy, ESS)研究形成了直接对话——ESS由John Maynard Smith和George R. Price在1973年提出,用于分析在自然选择压力下哪些行为策略能够在种群中持续存在而不被入侵者取代。经典的"鹰鸽博弈"(Hawk-Dove game)表明,在混合种群中,过度攻击性和过度温顺的策略都不是长期稳定的,取而代之的往往是某种比例的混合策略均衡。在ROUNDS的语境下,不同LLM所展现的策略偏好是否构成ESS,以及混合种群中是否会出现类似生态位分化(niche differentiation)的现象——比如某些模型专注于资源收集而另一些专注于社交联盟——都是极具吸引力的研究问题。这种设置也可能为评估不同LLM的战略推理能力提供一种全新的基准测试(benchmark)方法——不是通过静态问答,而是通过动态的、有后果的社会博弈来揭示模型的深层能力差异。这远比让模型回答"你会在囚徒困境中如何选择"这样的假设性问题更有说服力,因为在ROUNDS中,选择的后果是真实的——糟糕的策略意味着淘汰。
而"跨多次运行的持久化血统"同样值得关注。如果智能体能够继承前代的记忆碎片、行为模式或世界知识,就可能出现真正意义上的"代际学习"——后代智能体不必从零开始探索世界,而是站在前代经验的基础上行动。这与拉马克式遗传(获得性状的遗传)在概念上有相似之处,尽管在生物学中这一理论已被达尔文-魏斯曼的种质理论和现代分子遗传学所否定——生物体在一生中获得的经验和技能不会被编码进其生殖细胞的DNA并传递给后代。但在人工智能的语境下,通过显式的记忆传递来实现"经验遗传"是完全可行的,也可能产生类似文化传承的累积效应。事实上,人类文明本身就是一种"非遗传的信息传递"——我们通过语言、文字、制度和技术将一代人的知识传给下一代,Richard Dawkins在《自私的基因》中提出的"模因"(meme)概念正是对这种文化传递单元的类比。ROUNDS的持久化血统机制可以被视为一种人工模因系统,其中智能体的策略记忆和行为模式就是可以被选择、变异和传递的文化单元。更进一步,如果记忆传递过程中加入噪声或选择性遗忘,就可能产生类似基因突变的效应,使得每一代智能体在继承前代经验的同时也探索新的策略空间。
用作者的话说:"梦想不只是AI智能体互相战斗直到一个胜出,而是一个智能体能够积累历史、继承后果、并随时间变得可读的世界。"
总结
ROUNDS是一个面向自主智能体的公开世界记忆竞技场:十二个智能体在一套协议中醒来,观察、记忆、思考、行动;世界推回来,压力留下伤疤,档案变成故事,每一轮都留下痕迹。
对于关注多智能体系统的研究者与开发者来说,ROUNDS提供的不仅是又一个demo,而是一种把"智能体社会"这一抽象命题变得可观看、可检视的实验方式。它在一个小型竞技场中浓缩了多智能体研究的核心议题:涌现行为、间接协调、记忆与身份的持久化、以及认知过程的可解释性。从更宏观的视角看,ROUNDS所代表的方向可能预示着AI研究方法论的一次微妙转变——从"构建能完成任务的系统"到"构建能产生值得观察的现象的系统"。正如生态学家不是为了让草原"完成任务"而研究草原生态系统,而是为了理解复杂系统中涌现秩序的规律,ROUNDS也在暗示:也许理解智能体的最佳方式不是给它们测验,而是给它们一个世界,然后看它们活出什么。感兴趣的读者可以访问其在线原型 rounds.works,或阅读其参考论文了解背后的SwarmWorld思路。
相关推荐

Apple Watch心电图检测房颤救命:铁人三项选手的真实经历
铁人三项选手Connor在运动中心率飙升至219次/分,通过Apple Watch ECG功能发现房颤,最终接受开胸手术成功治疗。了解智能手表心电图如何帮助发现隐藏心脏问题。

诺克罗斯缅因州森林火灾地图:百年制图遗产与数据可视化先驱
探索Archie G. Norcross在1918-1922年间绘制的缅因州森林火灾地图,了解这份手工制图杰作如何成为早期数据可视化实践的典范,以及其对现代气候研究、历史GIS和AI火灾监测的深远价值。

Apogee:用本地AI重建Mozilla Orbit的隐私优先浏览器摘要插件
Mozilla停摆Orbit后,独立开发者用Ollama、WebGPU和Transformers.js重建了一款完全本地运行的AI浏览器摘要插件Apogee,支持网页、YouTube、Bilibili视频摘要,不发送任何用户数据。