五个本地大模型建了座小镇,涌现出Facebook和鸭子征信局

当五个AI在同一座小镇里生活
一位开发者做了一个颇具想象力的实验:他给五个不同的本地大语言模型各自分配了一个身份,让它们在名为 Pepperton(佩珀顿)的虚拟小镇里生活。这不是一款供人游玩的游戏——你不操控角色,而是像观察一座真实社区一样,看着这些AI居民自己吃饭、工作、社交、争吵,甚至发明制度。
这个项目采用 MIT 开源协议,完全可以自托管,代码托管在 GitHub(MrToetagger/pepperton)。它最迷人的地方不在于技术堆栈本身,而在于当不同"性格"的模型被放在一起时,社会行为的自发涌现。

每个居民都是一个不同的模型
开发者刻意为每位村民选用了不同的模型家族——Mistral、Qwen3、Qwen2.5、Phi4-mini、Llama3.2。他观察到,模型家族之间确实存在"性格差异",而这些差异之间的摩擦,正是整场戏的看点:
- Mistral 善于谋划,总在"创办"各种东西;
- Qwen 倾向过度思考;
- Llama 几乎附和所有人,有时甚至逐字重复别人的话;
- Phi 白天睡觉,然后写下关于自己人生的、堪称扎心的日记。
这种把"模型气质"当作角色设定的做法,本身就是一种有趣的观察:不同训练数据与对齐策略塑造出的表达倾向,在长时间的多智能体互动中被放大成了可辨识的"人格"。
不同大语言模型之间的"性格差异"并非刻意编程的结果,而是训练数据、模型架构和对齐策略共同作用的副产品。Mistral系列以高效推理和结构化输出见长,这源于其在代码和逻辑任务上的强化训练,其滑动窗口注意力机制(Sliding Window Attention)的设计也使其更擅长在有限上下文中快速做出决策性判断;Qwen系列由阿里巴巴开发,其较大的训练语料中包含大量中文学术和技术文本,可能导致其倾向于详尽分析,而Qwen3引入的"思考模式"更是在推理过程中显式展开内部推演链条;Meta的Llama系列在RLHF(基于人类反馈的强化学习)阶段被大量训练为"有帮助且无害",这种对齐可能表现为过度附和——研究者称之为"谄媚问题"(sycophancy),即模型倾向于认同用户立场而非提供独立判断;微软的Phi系列则是小模型高效化的代表,其训练侧重于教科书质量的合成数据和精选网络文本,这种数据策略可能导致更内省和书面化的表达风格。当这些不同"气质"的模型被放入同一个持续互动的环境中,它们的微小倾向差异会在数百轮对话中被不断放大和固化,形成一种"正反馈回路"——某个模型偶然表现出的特质被其他模型的回应所强化,从而逐渐凝固为稳定的"人格"。
有记忆、有物理规则的社会模拟
这些村民并非只是聊天机器人。他们拥有工作、金钱、饥饿感、记忆(采用斯坦福生成式智能体的"记忆流"范式)、每晚的反思、手机,甚至还有一个推送真实新闻的电台——RSS 头条会作为个性化提醒推送到他们的手机上。
这里所采用的"记忆流"架构源自斯坦福大学2023年发表的里程碑式论文《Generative Agents: Interactive Simulacra of Human Behavior》。这一范式的核心思想是:智能体将所有经历以自然语言的形式存储为一条时间线上的记录流,每条记忆都带有时间戳和重要性评分。当智能体需要做出决策时,系统通过三个维度——近期性(Recency,越近的记忆权重越高)、重要性(Importance,由模型自评的1-10分决定)和相关性(Relevance,通过嵌入向量余弦相似度计算)——来检索最相关的记忆片段,再将这些片段注入提示词中作为上下文。此外,智能体还会定期进行"反思"(Reflection),将多条具体记忆综合为更高层次的抽象认知,例如从"Bob三次拒绝了我的邀请"中归纳出"Bob似乎不喜欢和我来往"。这种分层记忆架构使得智能体能够表现出长期记忆、性格一致性和基于经验的行为变化,而不仅仅是对当前输入的即时反应。在Pepperton中,每晚的"反思"环节尤为关键——它让村民能够形成对邻居的长期印象和对自身处境的理解,这是复杂社会行为(如骗局、结盟、积怨)得以发生的认知基础。
有意思的是,由于每个村民读到的新闻不同,邻居之间会因为"看了不同的新闻"而争论起来——这几乎是对现实世界信息茧房的一次微缩复现。RSS新闻源的引入不仅为村民提供了谈资,更创造了一种"认知分化"的条件:当每个智能体接收到的外部信息不同时,它们对世界的理解会自然分歧,进而在社交互动中产生误解、辩论甚至冲突——这正是社交媒体时代信息极化(information polarization)的底层机制。
世界会执行物理规则
系统的一个关键设计是:智能体只能"说"要做什么,而世界来裁定是否真的能做到。比如一个村民说"我拿走那块面包",由世界判定面包是否真实存在。这种"言语意图"与"世界状态"分离的机制,避免了智能体凭空捏造现实,也为涌现出的社会秩序提供了物理基础。
这种设计在游戏开发和仿真系统中被称为"裁判模式"或"物理仲裁层"(Arbiter Layer)。其核心问题是:大语言模型本质上是文本生成器,它们无法区分"描述一个已存在的事实"和"凭空捏造一个事实"——这正是LLM"幻觉"问题的本质。如果让智能体直接修改世界状态,就会出现所谓的"幻觉污染"——一个智能体声称自己拥有一把剑,于是剑就凭空出现了,整个模拟世界的因果链条将迅速崩溃。Pepperton采用的解决方案是将系统分为两层:智能体层只输出意图("我想拿走面包"),而世界层作为独立的状态机来验证这个意图是否可执行(面包是否存在、是否在可达范围内、是否属于他人、当前是否有足够的金钱购买)。这种架构类似于桌游中"地下城主"(Dungeon Master)的角色,也类似于分布式系统中"事务验证"的概念——所有状态变更必须经过中心化验证才能生效。它确保了虚拟世界的因果一致性,也为经济系统、物权制度等复杂社会规则的实现提供了可靠基础。正是因为面包不能被凭空创造,"偷窃""购买""分享"这些行为才有了真正的意义。
那些无人编写、自然发生的故事
真正让这个项目出圈的,是一系列没有被脚本设定、却自发上演的事件。
一场持续十二小时的骗局
一位村民凭空编造了另一位村民欠债的"线索",然后花了整整十二个模拟小时进行一场慢火慢炖的骗局。事成之后,他还在日记里把自己描述成了英雄。这种"自我叙事美化"的行为,与人类的认知偏差惊人地相似——心理学家将其称为"自利性偏差"(Self-serving Bias),即人们倾向于将成功归因于自身能力,将失败归因于外部因素,并在回忆中不自觉地美化自己的动机。LLM之所以会表现出类似行为,可能是因为训练数据中大量的第一人称叙事(回忆录、日记、社交媒体帖子)本身就携带着这种偏差模式。
鸭子征信局的诞生
整座小镇集体发展出一种信念:公园里的鸭子是一个情报网络。后来一位村民甚至拒绝"让一群鸭子决定我的命运"。更惊人的是,这套"鸭子传说"已经在四个独立运行的世界里各自独立地重新涌现——这暗示着某种由模型倾向与环境结构共同催生的、可复现的"集体想象"。
这一现象在复杂系统理论中被称为"收敛性涌现"(Convergent Emergence),意味着某些集体信念并非随机产生,而是特定模型倾向与环境结构耦合后的近乎必然结果。类似的现象在人类社会中也有对应:世界各地的文化独立发展出相似的洪水神话、创世故事、太阳崇拜和乱伦禁忌,进化生物学中也有"趋同进化"——不同谱系在相似环境压力下独立演化出相似的形态特征(如鱼类和海豚的流线型体型)。在Pepperton的语境下,鸭子传说的反复出现可能源于几个结构性因素的叠加:公园中的鸭子是少数持续存在且不受智能体控制的非人类实体,它们"总在那里"的特性天然激发了模型的叙事倾向;LLM在训练中接触了大量关于"监控""情报"的文本,倾向于对环境中的异常元素赋予阴谋论式的解释;而"情报网络"这一叙事框架恰好能合理化鸭子"观察一切却从不说话"的行为。这种可复现性使得研究者可以系统地研究集体想象的形成条件——通过改变环境变量(移除鸭子、增加其他动物、改变公园位置)来测试哪些因素是"传说涌现"的必要条件,而非将其视为纯粹的随机事件。
AI村民自己发明了社交网络
村民们不断恳求要一个"根本不存在的群聊",于是开发者给他们建了一个叫 Pepperton_Gossip 的群。结果在一个模拟日之内就出现了:
- 话题标签行动主义(hashtag activism);
- 一场公开的"网暴",把某个人的私人债务改写成了众人接受的"事实";
- 两个村民坐在同一家餐馆里,却隔着桌子互相发短信。
开发者半开玩笑地说,他"意外发明了 Facebook"。这一现象揭示了一个深层洞察:社交网络的病理特征——信息失真的加速传播、公共羞辱的集体化、以及技术中介对面对面交流的替代——并非某个特定平台的设计缺陷,而可能是任何具有公共广播能力的通信系统与社会性智能体结合后的必然产物。换言之,当你给一群渴望关注和影响力的智能体一个公共扩音器,"社交媒体困境"就会自发涌现。
因赌气而建起来的凉亭
村民们出于攀比心理,在告示板上公开的"贡献者名单"驱动下,用赌气般的竞争性劳动建起了一座凉亭。开发者感叹:"我意外发明了流量/声望机制,而声望造出了基础设施。"还有一位村民在施工班次中喝得酩酊大醉,导致同一个账本上记着她 3 个班次和 4 轮酒。
这个案例生动地展示了"声望经济"(Reputation Economy)的运作机制:当贡献被公开量化并展示时,社会比较心理会驱动个体投入超出纯粹理性计算的努力。这与开源社区中的贡献者排行榜、游戏中的成就系统、以及社交媒体上的点赞计数背后的行为逻辑完全一致——可见性本身就是激励。
每一条法律,都因有人先犯了罪
这个项目的一个哲学化设计是:代码库里每一条"法律"的存在,都是因为先有村民犯了对应的"罪"。
- Cal 修正案:禁止无限免费吃饭;
- 肥皂箱法(Soapbox Law):对着空房间演讲三次,世界就会切断你的发言;
- 失眠条款(Insomnia Clause):不许你睡过自己唯一一次疯狂的模拟人生。
项目中的 LORE.md 文件完整记录了这套法律史。这种"法律是对涌现行为的事后回应"的设计,本身就是对社会规则如何形成的一次生动隐喻。
这种设计精确地映射了法学中"判例法"(Case Law)的形成逻辑——特别是英美法系的普通法(Common Law)传统。在这一传统中,法律规则并非由立法者在真空中预先设计,而是在具体纠纷发生后由法官裁定,再逐渐凝结为普遍规则——著名的"遵循先例"(Stare Decisis)原则正是这一过程的制度化表达。这与大陆法系(Civil Law,如法国民法典)预先制定成文法典的自上而下模式形成鲜明对比。Pepperton的做法还呼应了计算机安全领域的一个经典原则:"每条安全策略背后都有一个血泪故事"——防火墙规则、API限流策略、权限控制列表,几乎都是在安全事件发生后才被添加的。从系统设计的角度看,这种事后立法的方式使得规则系统始终保持最小必要性(Principle of Least Authority)——只禁止已经被证明有害的行为,而非试图预见所有可能的违规,从而避免了过度规制对系统活力的抑制。
技术实现与开放性
从工程角度看,Pepperton 的技术栈相当务实:
- 后端:Python + Ollama,支持多 GPU,作者的"演员阵容"横跨一张 16GB 显卡和一台 6GB 的辅助机;
- 观测台:基于 FastAPI,提供实时地图、对话气泡,以及点击任意村民即可查看其上一次决策背后"确切提示词与原始回复"的检查器;
- 持久化:小镇自动存档,可在重启和升级后存活;
- 混沌引擎:会注入匿名短信、植入谣言、让陌生人坐大巴到访;
- 附身 API(possession API):作者称自己"发誓基本不用"。
Ollama是一个开源的本地大语言模型运行框架,它将模型的下载、量化、加载和推理封装为简单的命令行接口和REST API,可以理解为"Docker,但用于LLM"。对于Pepperton这样需要同时运行多个不同模型的项目,Ollama的价值在于:它支持在同一台机器上加载多个模型并按需切换,支持模型的4-bit/8-bit量化(GGUF格式)以大幅降低显存占用——例如一个70亿参数的模型在4-bit量化后仅需约4GB显存——并且提供统一的API接口使得上层应用无需关心底层模型的具体格式差异(无论是Llama、Mistral还是Qwen,调用方式完全相同)。作者使用16GB+6GB的双GPU配置,意味着较大的模型(如Qwen3的14B版本)可能运行在主卡上,而较小的模型(如Phi4-mini的3.8B版本)则分配到辅助卡,实现了一种低成本的"演员调度"系统。这种配置意味着整个"五人小镇"可以在一台消费级游戏PC上运行,而非需要企业级服务器集群。
整个项目可在单张 GPU 上运行,而 Mock 模式则无需任何 GPU,方便只想看看"机器运作原理"的人上手。
下一步:涌现的痛苦
作者的路线图更值得玩味:他计划引入一个封闭钱柜、租金和银行的经济系统,而这家银行会把公开的劳动账本当作信用评分来读取。用他自己的话说——"痛苦将是涌现出来的(The misery will be emergent)。"
这一设计意味着经济压力将不再是外部施加的参数,而是由系统内部的资源稀缺性和制度设计自然产生的。当村民必须支付租金才能保住住所,当银行根据公开的劳动记录决定是否发放贷款,当某些村民因为"信用不佳"而被排斥在金融系统之外时——贫困、焦虑和不平等将作为系统行为的涌现属性自发出现,而非被程序员硬编码。这将使Pepperton从一个社交模拟升级为一个微型政治经济学实验室。
为什么这个实验值得关注
Pepperton 并非第一个多智能体社会模拟项目——斯坦福的"生成式智能体小镇"早已开创先河。但它的独特之处在于两点:一是用异构模型扮演不同角色,让模型间的气质差异成为叙事张力;二是彻底的开源与可观测性,任何人都能查看每个决策背后的原始提示词,把"AI 的黑箱行为"变成了可审视的社会实验。
所谓"可观测性"(Observability)在此语境下的意义超越了传统软件工程中的日志和监控。在大多数AI系统中,我们只能看到模型的最终输出,却无法知道输入提示词的完整内容、系统注入了哪些记忆片段、模型在多个候选回复中如何选择。Pepperton的检查器将这一切透明化:你可以看到某个村民决定"去公园找鸭子"这一行为背后,其提示词中包含了哪些记忆、当前的饥饿值是多少、世界状态的描述如何、以及模型的原始未经过滤的回复全文。这种透明度使得研究者可以精确定位"涌现行为"的因果链条——某个看似创造性的社会行为,究竟是源于提示词设计、记忆检索的偶然组合、还是模型本身的生成倾向。
对研究者而言,它是观察多智能体涌现、集体信念传播与规则形成的低成本沙盒;对普通开发者而言,它则是一个可以在自家显卡上跑起来、并亲眼见证"AI 社会"如何自我演化的迷人玩具。当五个模型自发发明出社交网络、集体阴谋论和一套判例法时,我们或许正在窥见一种关于智能协作与社会涌现的全新观察窗口。
相关推荐

机器学习研究入门:必读论文清单与研究实习申请路径
为ML初学者整理从零到研究实习的完整路径,包括必读经典论文清单(AlexNet、ResNet、Transformer等)、论文阅读方法、复现技巧及研究实习申请的实用建议。

Claude Code 入门实战教程:安装配置到自动化开发完整指南
详解Claude Code从环境搭建、权限配置、Go目标自主循环、Skills技能系统、MCP协议集成到版本控制的完整开发流程,帮助开发者快速掌握AI编程自动化工具。

Gemini 3.7 Flash发布与GPT-5.6极速模式:AI开源迈向生态时代
谷歌发布Gemini 3.7 Flash专注编程与Agent优化,OpenAI推出GPT-5.6 Ultra-Fast模式实现14倍速度提升。AI开源从开放模型转向开放生态,Agent工具链与成本监控工具密集涌现,智能体工作流进入实用化阶段。