Poolside Laguna模型发布:硅谷开源能否追上中国AI?

Poolside沉寂18个月后携Laguna模型重磅回归
2024年10月,Poolside还是硅谷炙手可热的AI新星。这家由前GitHub CTO Jason Warner联合创办的初创公司,以30亿美元估值募得5亿美元资金,专注为政府和大型企业打造编程智能体(coding agents)。编程智能体是当前AI应用最前沿的领域之一,它超越了传统代码补全工具(如GitHub Copilot),能够自主理解需求、规划实现路径、编写完整功能模块、调试错误并进行测试验证。与简单的代码生成不同,智能体具备"代理性"(agency)——即能在多步骤任务中自主决策、调用工具、与环境交互。这一赛道的商业价值巨大,麦肯锡估计全球软件开发市场规模超过6000亿美元,而编程智能体有望将开发效率提升数倍。
然而在随后的18个月里,Poolside几乎从公众视野中消失——同时,OpenAI和Anthropic的估值一路膨胀至接近万亿美元,而一批中国实验室凭借开源模型紧追不舍。
如今Poolside带着名为Laguna的新模型重新登场。根据福布斯报道,在公开基准测试中,Laguna击败了它的美国及中国开源竞争对手——唯一显著的例外是中国实验室Moonshot最新发布的Kimi K3。Warner作为Poolside的联合CEO兼联合创始人向福布斯表示:
"作为一家为西方而构建的美国公司,我们将成为西方最有能力的开放模型。在全球范围内,在这个1180亿参数的重量级别里,我们是领导者。"

Poolside的"工业化造模型"策略:从手工作坊到流水线
Warner声称,在那段沉寂期里,Poolside一直在搭建一套所谓的"模型构建工厂"(model-building factory)基础设施,能够源源不断产出Laguna,并每五周迭代出更新、更强的版本。
他的一句话颇具野心:"传统的模型构建是一个手工作坊式的过程,而我们建立的是一套工业化的模型构建流程。"
要理解这句话的分量,需要了解传统大模型训练的现实:通常依赖大量人工干预——研究员需要手动调整超参数、设计数据配比、诊断训练中的loss spike等异常现象,每次训练run都像一次高风险实验。Poolside所谓的"工业化"意味着将这一过程系统工程化:包括自动化的数据管道(持续采集、清洗、去重、质量评分)、自适应的训练调度系统、标准化的评估框架(涵盖数十个维度的自动化测试)、以及模型版本管理和回滚机制。这种方法论借鉴了软件工程中CI/CD(持续集成/持续部署)的理念,将模型迭代从"科学实验"转变为"工程流程"。Meta的Llama系列和Google的Gemini团队也在内部实践类似的系统化方法,但Poolside是少数将此作为核心竞争力公开宣传的公司。
这一表述折射出当前AI竞争的本质变化——从单点突破的"炼丹"式研发,转向可持续、可复制的规模化生产。谁能把训练、评估、迭代变成标准化流水线,谁就可能在长期竞赛中占据优势。
不过Warner也坦承,Laguna要匹敌OpenAI、Anthropic的顶级闭源模型,以及Moonshot发布的新版Kimi K3,还有很长的路要走。但他强调一个关键差异:Poolside的模型体积要小得多。
参数量悬殊对比:Laguna 118B vs Kimi K3 2.8万亿
这里出现了一个耐人寻味的对比。据福布斯披露,Moonshot称Kimi K3是一个2.8万亿参数的模型,足足是Poolside Laguna(1180亿参数)的约20倍。

理解这一对比需要一些技术背景。参数量是衡量模型规模的基本指标——每个参数本质上是神经网络中一个可学习的数值权重。然而参数量与模型能力之间并非简单的线性关系。影响最终表现的因素还包括:训练数据的质量和多样性(Chinchilla定律指出数据量应与参数量匹配)、模型架构的效率(如Mixture of Experts/MoE架构可在推理时只激活部分参数,大幅降低计算成本)、训练后对齐技术(RLHF、DPO等)的质量,以及推理时的计算策略(如思维链、搜索增强等)。Kimi K3的2.8万亿参数很可能采用了MoE架构,实际推理时激活的参数量远小于总量,这也部分解释了其能以较低成本提供服务的原因。
这一悬殊揭示了两种截然不同的技术路线:
- 中国实验室:倾向于用超大规模参数(通常搭配MoE架构)追求极致能力
- Poolside:试图在更小的密集型(dense)模型体积内实现高效表现
Warner表示,公司计划构建更大的模型,最终有望与前沿实验室(Frontier Labs)正面竞争。今年早些时候,Poolside还悄然推出了一个规模更小的模型系列,并从一开始就向数量不详的政府和企业客户分享模型权重,自4月起开始公开分享。
名义"硅谷公司",实为全球分布式团队
Poolside自称总部位于旧金山,但其运作更具国际色彩。联合创始人Warner往返于加拿大和旧金山之间,另一位联合创始人则常驻葡萄牙,团队大部分成员远程办公。据以往报道,公司曾以法国巴黎为总部,程序员们每隔几个月才在那里集结一次。

这种分布式、国际化的组织形态,某种程度上也反映了当下AI人才与资本流动的全球化现实——"美国公司"的标签背后,往往是跨越大洲的协作网络。这并非个例:Mistral(法国)的许多核心研究员曾在Google和Meta工作,Cohere(加拿大)在全球多地设有研发中心,而即便是OpenAI本身也有大量非美籍员工。在AI领域,人才的稀缺性使得地理边界变得模糊,公司注册地与实际知识生产地之间的错位日益常态化。
前OpenAI、前GitHub高管纷纷入局开放权重赛道
硅谷正急于打造对抗中国AI的本土替代方案,这些方案常被冠以"开源"之名。不过需要澄清一个关键概念:
像DeepSeek这样的中国初创公司并不公开代码或训练数据,而是发布所谓的**"模型权重"(model weights)**,允许开发者下载、本地运行并微调模型。
在AI行业,"开源"一词被广泛滥用。严格意义上的开源应包括:模型权重、训练代码、训练数据、数据处理管道和完整的复现文档。而"开放权重"仅发布训练完成的模型参数文件——用户可以下载、运行和微调,但无法了解或复现训练过程。这一区别至关重要:开放权重让下游开发者受益(降低使用成本、允许定制化),但并不构成真正的科学透明度。OSI(开源促进会)在2024年发布了AI开源的正式定义,明确要求训练数据的充分披露。目前Meta的Llama、DeepSeek的模型以及Poolside的Laguna都属于"开放权重"而非完全开源。这种模式的商业逻辑在于:通过开放推理层获取生态影响力,同时保留训练层的竞争壁垒。
正是这种开放权重的模式,对那些不愿受制于OpenAI和Anthropic闭源模型控制、又苦于ChatGPT和Claude高昂使用成本的初创公司乃至大企业极具吸引力。
上周,前OpenAI CTO Mira Murati创办的Thinking Machines Lab也发布了首个AI模型——一个名为Inkling的开放权重模型。与AI行业无休止的炒作形成鲜明对比,该实验室坦言:这并非当前"最强的整体模型(无论开源还是闭源)",但它的定位是灵活、易于定制。

OpenAI、Google乃至Nvidia也都投身开放权重的赛道。曾凭借Llama拥有领先开源模型的Meta,去年却转向了一个名为Spark的新闭源模型。
追赶的残酷现实:Kimi K3已能撼动美股
迄今为止,鲜有西方模型能接近顶级中国模型的能力,而其中最强势的正是来自Moonshot的产品。据AI榜单Arena显示,Kimi K3在部分编程任务上超越了OpenAI和Anthropic的顶级模型。
这里提到的Arena(即Chatbot Arena/LMArena)是由UC Berkeley的LMSYS团队运营的众包评测平台,采用类似国际象棋的Elo评分系统——让真实用户盲测比较两个模型的回答质量,通过大量人类偏好投票得出排名。与传统静态基准(如MMLU、HumanEval)不同,Arena的优势在于更贴近真实使用场景、更难被针对性优化(即"刷榜")。目前Arena已成为业界公认最有参考价值的综合评测之一,其编程子类别(Coding Arena)尤其受到开发者关注。
尽管Kimi K3在某些指标上仍有落后,但同样任务下它的收费比Anthropic低约三分之二、比OpenAI低约三分之一。
如此强大且廉价,以至于它在7月发布后一度惊动了美股市场——这与2025年1月DeepSeek R1发布后引发美股科技板块大幅震荡的情形如出一辙,投资者担忧中国模型的高性价比可能颠覆西方AI公司的定价权和商业模式。过去一个月,LLM市场平台OpenRouter报告称,来自小米、腾讯等中国企业以及ZAI等初创公司的模型,位列最受欢迎的前五名。
不过对美国企业而言,一个现实的障碍是:目前Kimi K3只能在Moonshot位于中国境内的服务器上运行,这让美国公司在采用时不得不三思。这一限制涉及多层面的地缘政治考量:美国企业将代码和商业逻辑发送至中国服务器,可能违反ITAR(国际武器贸易条例)、EAR(出口管理条例)等法规,对国防和金融等敏感行业尤其如此。此外,2024年美国商务部提出的规则制定提案已明确将AI模型服务视为潜在的受控技术交易。这种"技术脱钩"的现实,恰恰为Poolside等西方开放权重模型创造了明确的市场空间——企业需要性能接近中国模型、但可在本地或西方云基础设施上运行的替代方案。
结语:一场不对称的AI竞赛才刚刚开始
综合来看,硅谷的开源反击战已经打响。前OpenAI CTO、前GitHub CTO等重量级人物纷纷下场,Poolside的"工业化造模型"理念也颇具想象力。
但残酷的现实摆在面前:无论从基准表现、参数规模,还是从性价比和市场受欢迎程度看,中国开放权重模型目前都占据着明显优势。Poolside用1180亿参数挑战2.8万亿参数的Kimi K3,正是这场竞赛不对称性的缩影。
西方要真正追赶,需要的或许不只是几个明星创始人和响亮的口号,而是能否将"工业化"承诺兑现为持续领先的实际成果。这场竞赛的终局,取决于谁能更快地将技术路线转化为可落地的商业价值——而在编程智能体这一垂直领域,商业价值的衡量标准最终将落在一个朴素的问题上:谁的模型能让开发者写出更好的代码、更快地交付产品。
核心要点
相关推荐

Agent智能体开发入门:从概念到实战的完整指南
深入解析AI Agent智能体的核心架构与开发实战,涵盖自动化营销、智能客服、投资分析三大落地场景,以及单智能体与多智能体协作机制,帮助初学者快速掌握Agent开发思维与实践路径。

Codex五分钟建站真相揭秘:不是AI做网站,是AI帮你抄网站
揭秘短视频平台上火爆的Codex五分钟建站内容真相:博主们并非用AI原创网站,而是复制共享提示词或直接扒别人网站。了解AI编程工具的真实能力边界,别被焦虑营销带节奏。

提示词工程入门指南:从单次指令到系统化方法论
提示词工程零基础入门教程,详解提示词的四大作用、提示词与提示词工程的核心区别、六步系统化流程,以及必须了解的技术与落地局限性,帮你真正发挥AI的全部潜力。