Mythos Preview参数规模分析:10万亿参数与Scaling Law的验证

近日,一条关于Anthropic下一代模型「Mythos Preview」的推文在AI社区引发广泛讨论。作者通过定价、基准测试、算力推算等多个维度的交叉分析,得出了一个引人注目的结论:Mythos Preview 很可能是一个接近 10万亿(10T)参数 的超大规模模型,其规模超过了 Mythos 5 和 Fable。
本文将梳理这一分析的完整逻辑链,并探讨其对「Scaling Law(规模定律)是否仍然有效」这一核心命题的启示。

从定价反推Mythos Preview的参数规模
分析的第一条线索来自定价。据推文披露,Mythos Preview 的输出token定价高达 $125/百万tokens,是 Opus 的 5 倍、Fable 的 2.5 倍。
定价与模型参数量的对应关系
在大模型商业化的实践中,推理成本(进而影响定价)通常与模型的激活参数量呈近似正比关系。这背后的技术原理是:在Transformer架构中,每生成一个token需要经过模型所有层的前向传播计算,计算量与激活参数量近似成正比。具体而言,对于一个拥有N个参数的模型,生成每个token大约需要2N次浮点运算(一次乘法加一次加法),这意味着参数量翻倍,单token推理计算量也近似翻倍,直接推高了GPU计算时间和能耗成本。
对于稠密模型(Dense Model),激活参数量等于总参数量——模型的每一个参数在每次推理中都参与计算。而对于混合专家模型(Mixture of Experts, MoE),架构中包含多组「专家」子网络,每次推理时由一个门控网络(gating network)根据输入内容动态选择少量专家参与计算,因此激活参数量远小于总参数量。例如,传闻中GPT-4采用了约1.8T总参数的MoE架构,但每次推理仅激活约220B参数。这种设计在保持模型容量(即能存储的知识总量)的同时显著降低了单次推理成本,是当前大模型架构演进的重要方向。Mythos Preview究竟采用稠密架构还是MoE架构,目前尚不确定,但无论哪种架构,其高昂定价都指向了极大的激活参数规模。
在同一厂商产品线内,由于推理优化技术通常被统一应用,定价比值仍能大致反映模型规模比值。这里涉及的关键优化技术包括:KV-Cache(键值缓存),即在自回归生成过程中缓存已计算的注意力机制中的Key和Value张量,避免对已处理token的重复计算,将推理复杂度从O(n²)降至O(n)级别;投机解码(Speculative Decoding),使用一个参数量较小的「草稿模型」快速生成多个候选token,再由大模型并行验证,从而将串行的逐token生成转化为部分并行处理,在不牺牲输出质量的前提下加速2-3倍;量化压缩(Quantization),将模型权重从32位或16位浮点数压缩至8位整数(INT8)甚至4位(INT4),以减少显存占用和内存带宽瓶颈,代价是微小的精度损失。由于这些技术通常是厂商在整个产品线中统一部署的基础设施级优化,它们会等比例地降低不同规模模型的推理成本,因此不同模型之间的定价比值仍然是规模差异的可靠近似。
作者以已知规模的 Opus 作为锚点进行推算:
- Opus 的参数量业界普遍认为在 1.5T–2T 之间;
- 若 Mythos Preview 定价是 Opus 的 5 倍,那么按线性外推,其规模应落在 7.5T–10T 区间。
同样的逻辑也适用于 Fable。作者估算 Fable 的定价约为 $50/百万tokens,通过 10T / ($125/$50) = 4T 的换算,推断 Fable 属于 3T–5T 量级——「只比 Kimi-K3 大一点」。这一数字与从「模型体感(vibes)」得出的判断相互印证。所谓「模型体感」是AI社区中一种非正式但广泛使用的评估方式——研究者和开发者通过实际对话互动来感受模型的知识深度、推理连贯性、创造力和指令遵循能力,这些主观感受虽难以量化,但往往能捕捉到标准化评测遗漏的质量维度,在实践中被证明与模型规模存在可感知的相关性。
需要注意的是,定价并不完全等于成本,厂商还会考虑市场策略、利润空间等因素,因此这一推算存在一定误差空间。例如,厂商可能对高端模型采取更高的利润率定价以筛选高价值客户,或者为了快速占领市场而对某些产品战略性降价。此外,不同模型的推理批处理效率(即能否高效地并行处理多个请求)也可能因架构差异而不同,进而影响单位成本。但作为多个独立线索之一,定价提供了有价值的量级参考。
基准测试表现:为何更早发布的模型反而更强
第二条线索来自基准测试的时间悖论。
更早发布却性能更强的反常现象
Mythos Preview 比 Mythos 5 早发布了两个多月,但在多项基准测试上反而超越了 Mythos 5,包括:
- UK AISI cyber ranges(英国AI安全研究所网络安全评测)——该机构是英国政府于2023年在布莱切利公园AI安全峰会上宣布成立的前沿AI评估机构,其cyber ranges评测模拟真实网络安全攻防场景,测试模型在漏洞发现、代码审计、渗透测试辅助等方面的能力。这类评测之所以重要,是因为它们测试的是模型将知识应用于复杂多步骤实际场景的能力,而非简单的知识记忆
- GPQA(Graduate-Level Google-Proof Questions and Answers,研究生级别专家问答)——由纽约大学等机构于2023年开发,包含448道需要博士级专业知识才能回答的问题,涵盖物理学、化学、生物学等学科。其设计特点是问题经过「Google-proof」验证,即即便使用搜索引擎也难以直接找到答案,必须依赖深层推理能力。在该评测中,人类领域专家的准确率约为81%,非专家仅约34%,这使其成为衡量模型深度推理与专业知识储备的严格标准
- HLE + tools(Humanity's Last Exam 配合工具使用)——由Scale AI与全球数百位各学科顶尖学者联合推出的极难评测集,汇集各学科最前沿的高难度问题,设计初衷是创建一个「在AI能力快速进步的背景下不会很快被饱和」的评测基准。当配合工具使用(如计算器、代码执行器、搜索引擎等)进行评测时,它不仅测试模型的知识储备,还考察模型识别自身知识局限并有效利用外部工具弥补的元认知能力
- OSWorld(操作系统环境任务)——评估模型在真实操作系统环境中执行复杂任务的能力,如操作文件系统、使用办公软件、管理浏览器标签页等。这类「Agent评测」需要模型理解视觉界面、规划多步操作序列并处理执行中的意外情况,被认为是连接语言理解与实际行动能力的关键桥梁
- 多数病毒学任务——这类评测通常属于生物安全风险评估范畴,测试模型在病毒基因序列分析、感染机制理解等方面的专业能力,是各大AI实验室安全评估中的重要组成部分
这些评测覆盖了从知识深度到实际操作、从安全推理到元认知判断的多个维度。一个模型若能在所有这些指标上同时超越另一模型,通常意味着基础能力的系统性提升而非单项优化——因为针对单一评测的优化(如特定领域微调)很难同时在如此多元化的任务上产生跨领域增益,而模型基础规模的扩大则能通过增加内部表征容量来实现普遍性提升。
作者的推理逻辑是:如果 Mythos Preview 与 Mythos 5 是同一规模,那么晚发布两个月、多训练两个月的 Mythos 5 理应更强。在大模型训练中,后期迭代通常会受益于更多的数据清洗经验、更好的超参数调整、更精细的RLHF(基于人类反馈的强化学习)对齐训练,以及从早期版本用户反馈中发现的问题修复。「除非你相信额外两个月的训练反而降低了模型分数」——这显然不合常理。因此更合理的解释是:Mythos Preview 本身就是一个更大规模的模型,其规模优势足以压倒 Mythos 5 在训练时间和迭代优化上的后发优势。
校准能力提升印证模型规模扩大
更微妙的证据在于模型的校准(calibration)能力。校准在机器学习中指模型输出的置信度与实际正确率之间的一致性——一个校准良好的模型在表示「90%确定」时,其回答确实在约90%的情况下正确。从技术角度看,校准涉及模型对自身内部知识状态的元表征能力:模型不仅需要「知道答案」,还需要准确评估自己「知道得有多确切」。这种元认知能力依赖于模型内部足够丰富的表征空间——参数越多,模型能编码的知识状态越细粒度,从而能更精确地区分「确定知道」「模糊记忆」「有依据的推测」和「完全不知道」等不同的确信程度。
研究表明,校准能力与模型规模之间存在正相关,这一关系在多项实证研究中得到验证。例如,OpenAI在发布GPT-4.5时特别强调了其相较于GPT-4在校准方面的显著改善——GPT-4.5的「幻觉率」(即模型自信地给出错误答案的比例)大幅下降,而「诚实不确定」的比例上升。这种改善被OpenAI归因于模型规模的扩大以及更广泛的预训练数据覆盖,而非后训练阶段的特定优化。
历史上,当模型规模显著提升时,我们观察到模型对自身知识边界的判断更加准确,这体现在 SimpleQA 等评测中。SimpleQA是OpenAI于2024年10月开发的评测基准,包含4326道有明确事实答案的简短问题,专门测试模型在面对事实性问题时是否能准确判断自身知识边界——即该回答还是该承认不知道。其评分机制不仅考察回答的正确率,还特别计算「尝试回答但回答错误」的比例(即模型过度自信的频率),使其成为衡量校准能力的精确工具。
Mythos Preview 恰恰在 SimpleQA 上超越了 Mythos 5,同时也在 Anthropic 内部一项衡量「缺失引用诚实度(missing-reference honesty)」的评测中胜出——该指标进一步测试模型在无法找到支持证据时是否会坦诚告知用户,而非编造引用。这一指标与「幻觉」问题直接相关:在实际应用中,模型编造不存在的学术论文、法律条文或新闻报道是最具危害性的失败模式之一,因为用户难以快速验证这些虚假引用。校准能力的提升,往往是规模扩大带来的典型副产品——它不是通过针对性训练容易获得的能力,而是模型内部世界模型变得更加精细和可靠的自然结果,这为「更大模型」的判断增添了一重佐证。
算力推算:Project Rainier集群的训练时间线
第三条、也是最硬核的线索来自算力(FLOPs)推算。
从集群规模到训练算力的计算
据推文所述,Anthropic 拥有当时最大的计算集群「Project Rainier」。这是Anthropic与亚马逊AWS合作建设的超大规模计算集群,作为亚马逊对Anthropic高达80亿美元投资的重要组成部分。据报道,该集群采用数十万块高端GPU(可能为NVIDIA H100或更新的B200),部署在AWS的定制数据中心中。为了理解这一规模的意义,可以参考:NVIDIA H100单卡的FP16/BF16算力约为990 TFLOPS,一个拥有10万块H100的集群理论峰值算力约为1e20 FLOPS(每秒10^20次浮点运算),考虑到实际训练中的GPU利用率(通常在30%-50%之间,受通信开销、数据加载等因素制约),有效算力约为3e19-5e19 FLOPS。
该集群约在 2025年10–11月 首次用于训练。到 2026年2月,Anthropic 内部突然出现了可用的 Mythos Preview,意味着训练周期约为3-4个月。
作者据此推算训练所消耗的算力约为 5e26 – 1e27 FLOPs(即5×10^26到10^27次浮点运算)。这个数字可以通过简单的算术验证:如果集群有效算力为4e19 FLOPS,连续运行100天(约8.64e6秒),则总算力约为4e19 × 8.64e6 ≈ 3.5e26 FLOPs,再考虑集群可能的规模上限和运行时间的不确定性,5e26到1e27是合理的估计区间。
作为参照,GPT-4的训练估计消耗约2×10^25 FLOPs,Llama 3 405B约消耗4×10^25 FLOPs,Google的Gemini Ultra估计消耗约5×10^25 FLOPs,这意味着Mythos Preview的训练算力是GPT-4的25到50倍,是此前最大公开模型的10倍以上,代表了一个显著的代际跨越。
根据 Chinchilla 等训练最优法则,这一算力规模「恰好对应一个约 10T 参数的模型」。Chinchilla最优法则由DeepMind研究团队(Jordan Hoffmann等人)在2022年的论文《Training Compute-Optimal Large Language Models》中提出,其核心发现挑战了此前业界「参数越多越好」的共识。该法则的核心公式为:总算力C≈6ND(N为参数量,D为训练token数,系数6来自Transformer前向和反向传播的计算量分析),且最优训练应满足D≈20N——即训练数据量(以token计)应约为模型参数量的20倍。这与此前Kaplan在2020年提出的Scaling Law有显著差异:Kaplan最初的研究建议在固定算力预算下优先增大模型规模、而非增加训练数据,其推荐的数据-参数比例约为D≈5N。Chinchilla论文通过训练超过400个不同配置的模型,证明了Kaplan的早期建议导致了「欠训练」(undertrained)的模型——即模型参数量过大而训练数据不足。Chinchilla法则的验证案例是一个仅有70B参数但使用1.4T tokens训练的模型,在性能上超越了拥有280B参数的Gopher(仅使用300B tokens训练),有力证明了数据量与参数量应协同扩展的原则。
据此,若C=1e27,则最优配置约为N≈10T参数、D≈200T tokens。当然,实际训练中厂商可能会根据推理效率等考虑采用「过度训练(overtrained)」策略——即用更多数据训练较小模型。这一策略的商业逻辑在于:虽然训练成本相同,但更小的模型推理成本更低,当模型需要服务数百万用户、每天处理数十亿token时,推理成本往往远超训练成本。Meta的Llama系列是过度训练策略的典型代表——Llama 3 8B使用了15T tokens训练,数据-参数比高达约1875:1,远超Chinchilla建议的20:1。但即便考虑过度训练的可能性,5e26–1e27的算力规模也至少支撑一个数万亿参数级别的模型(例如,如果采用100:1的数据-参数比,则对应约3T-5T参数)。
算力这条线索的价值在于它相对独立于定价和基准测试——它从硬件与时间的物理约束出发,却得出了与前两条线索一致的结论。这种多维度交叉验证的收敛,正是该分析最有说服力之处。在科学推理中,当多个独立的、基于不同假设和数据源的估算方法指向同一数量级时(这在天文学中被称为"费米估算"的交叉验证),结论的可靠性会显著高于任何单一估算。
Scaling Law是否仍然有效:来自官方的信号
最后,作者引用了 Anthropic 高层的公开表态作为「官方暗示」。
Amodei与Kaplan的公开表态
Anthropic CEO Dario Amodei、首席科学家 Jared Kaplan 等人在博客中多次强调,Mythos Preview 是「Scaling Law 依然健在」的证明。
值得一提的是,Jared Kaplan正是Scaling Law的核心奠基人之一——他在2020年于OpenAI期间合著了开创性论文《Scaling Laws for Neural Language Models》,与Tom Brown、Sam McCandlish等人系统阐述了模型性能(以交叉熵损失衡量)与参数量、数据量、计算量之间的幂律关系。该论文的核心发现是:模型性能随这三个变量的增长呈现平滑且可预测的幂律改善,且这种改善在观测到的六个数量级范围内没有出现饱和迹象。这一发现为「越大越好」的路线提供了理论支撑,直接驱动了GPT-3(175B)、GPT-4(传闻1.8T MoE)、PaLM(540B)、Claude 3等大模型的开发决策——如果性能改善是可预测的,那么投入更多资金建设更大集群、训练更大模型就是理性的商业决策。Kaplan后加入Anthropic担任首席科学家,由他本人来宣称Scaling Law依然有效,既具有学术上的权威性(作为理论提出者),也具有实践上的可信度(作为实际参与10T级模型训练的决策者)。
作者敏锐地指出:如果 Mythos Preview 仅仅是相对 Opus 提升 1.5–2 倍的小幅扩展(例如从2T到3-4T),高层根本没有必要反复强调「规模定律有效」这一论断——因为这种幅度的扩展并不构成对Scaling Law怀疑论的有力回应。这种反复强调本身,就暗示着一次真正意义上的大规模扩展——一次在规模上实现了5倍甚至更大跃升、并带来了与幂律预测相符的性能提升的标志性实验。
对AI行业的意义与需要保留的判断
如果这一推断成立,它释放出一个重要信号:在业界普遍质疑「预训练规模化是否已触及天花板」的当下,一个约 10T 参数的模型带来实质性能力提升,将成为规模化路线仍有空间的有力证据。
这一背景需要进一步解释。从2024年下半年开始,业界出现了「Scaling Wall(规模墙)」的广泛讨论,这场讨论的起因包括多个交织的因素:首先是高质量训练数据趋于枯竭——互联网上的高质量文本总量估计在数万亿到十几万亿token之间,而前沿模型的训练数据量已接近甚至超过这一上限,导致厂商开始重复使用数据(多epoch训练)或依赖质量参差不齐的合成数据;其次是模型性能提升边际递减的实证观察——多家实验室据报道发现,在部分评测上,新一代模型的改进幅度明显小于上一代,暗示低垂的果实已被摘取;第三是合成数据训练效果存疑——用模型自身生成的数据训练下一代模型,理论上可能导致「模型崩溃(model collapse)」,即训练分布逐渐偏离真实数据分布,导致多样性和质量退化。这些问题让部分研究者和投资者质疑纯粹的规模扩展是否已接近极限。
与此同时,**推理时计算(test-time compute)**作为一条替代或互补的技术路径获得了广泛关注。其核心思想是:与其在训练阶段投入更多算力来训练更大模型(训练时计算),不如在模型实际回答问题时投入更多算力来提升回答质量(推理时计算)。具体技术包括:思维链推理(Chain-of-Thought),让模型显式地分步骤思考而非直接输出答案;搜索与验证(Search and Verify),让模型生成多个候选答案并通过自我验证或外部工具验证筛选最优解;迭代精炼(Iterative Refinement),让模型反复审视和修改自己的输出。OpenAI的o1/o3系列模型正是这一范式的代表——它们在回答复杂问题时会进行长达数分钟的「思考」,消耗的推理算力可达普通模型的数十倍甚至数百倍,但在数学、编程等需要深度推理的任务上取得了突破性表现。DeepSeek-R1等开源模型通过强化学习训练也展现了类似的推理能力。
推理时计算与预训练规模化之间的关系,目前业界尚存争议。一种观点认为两者是替代关系——可以用更小的模型配合更多推理时算力来达到大模型的效果;另一种观点认为两者是互补关系——更大的基础模型配合推理时计算可以达到更高的上限。如果Anthropic确实通过将预训练模型扩展至10T参数获得了系统性的能力飞跃,将有力支持第二种观点,表明预训练规模化和推理时计算是两个独立的改进维度,两者可以叠加而非互相替代。这也意味着,前沿AI能力的提升空间可能比「规模化已死」论者所预期的更加广阔。
当然,我们也需要保持谨慎。本文所有分析均基于推特作者的推理与业界传闻,Anthropic 官方并未公布 Mythos 系列的确切参数量——这在行业中已成为常态,自GPT-4起,主要厂商均停止公开模型的详细架构信息,原因包括竞争保密、安全考量以及避免公众过度关注单一数字指标。定价可能包含非成本因素,算力推算也依赖于对集群配置(GPU型号、数量、互联架构、利用率等)的假设。此外,该分析未考虑一些可能改变结论的因素,例如Anthropic可能采用了某种新型架构创新来降低推理成本但保持高定价,或者Mythos Preview可能是一个极度过度训练的较小模型。这些结论应被视为基于公开线索的合理推测,而非确证。
结语
综合定价、基准测试、算力推算与官方表态四条相互独立的线索,「Anthropic 拥有一个约 10T 参数模型」这一判断确实具备相当的可信度。正如作者所言:「这几乎已经不是一个问题了。」
无论最终数字是 7.5T 还是 10T,这一分析都提醒我们:在信息不透明的前沿模型竞争中,通过多维度交叉验证的方式,外界依然能够勾勒出大模型演进的大致轮廓——正如冷战时期的「克里姆林学」通过分析苏联官员在阅兵式上的站位来推断政治格局,AI社区也发展出了一套通过定价、算力、评测成绩等公开信号来推断模型规模的分析方法论。而其对 Scaling Law 命题的启示——即预训练规模化可能仍有数量级的扩展空间——也将在未来数月的模型发布中得到进一步检验。如果这一判断被证实,它不仅验证了Scaling Law的持续有效性,也可能重新点燃业界对更大规模计算基础设施投资的信心。
核心要点
核心要点
相关推荐

Vibe Coding实战指南:AI全链路开发打造一人公司
深入解析Vibe Coding开发模式,从需求分析、UI设计到多端部署和AI自动化运营,掌握AI协同开发全链路闭环,助力个人开发者独立完成产品落地与推广。

统一API运行多款开源OCR模型:10万页仅需60美元
VLM.run将DeepSeek-OCR-2、GLM-OCR、dots.mocr等开源OCR模型统一封装为OpenAI兼容API,10万页文档解析成本仅60美元。支持JSON结构化输出、MCP服务器集成,助力企业低成本实现大规模文档解析。

开机残留弹窗怎么删?软件卸载不彻底排查指南
软件卸载后开机仍有弹窗提示?本文从技术原理出发,详解Windows、macOS、Linux三大系统的启动项残留排查方法,教你彻底清除卸载残留的自启动配置。