实测Claude Opus 5:为何成为我的编码首选模型

注:本文基于B站/YouTube知名开发者Theo(t3.gg)的实测视频整理。为便于中文读者理解,文中Anthropic各模型代号沿用其视频中的化名——"Fable"对应大型旗舰模型(Opus级别),"Sol"(5.6)对应OpenAI旗舰模型,"Mythos"为未阉割的超大基座模型。
Anthropic在一个周五下午悄然发布了Claude Opus 5,而Theo在实测一整天后得出了一个略显反直觉的结论:这可能是你唯一需要的编码模型。为什么一个更小、更便宜、在部分知识测试上还略逊于自家旗舰的模型,反而成了他的日常编码首选?
反常识的性价比:便宜但没那么便宜
Opus 5的定价是每百万输入token 5美元、输出25美元,正好是旗舰Fable模型(10美元/50美元)的一半。Anthropic官方宣称它"以一半的价格接近前沿智能",但Theo提醒读者,这个"半价"并不像看上去那么美好。
关键在于token效率。Token是大语言模型处理文本的基本单位——一个英文单词通常被切分为1-2个token,中文字符则约1-2个token。在模型定价中,"输出token"(模型生成的回复)通常比"输入token"(用户发送的提示词和上下文)贵得多,因为生成过程的计算成本远高于理解过程。Opus 5虽然单价便宜,却比Fable消耗更多token。根据Artificial Analysis的数据,Fable完成单个任务约用33k token,而Opus 5要用约37k token。
这种更高的token消耗本质上反映了模型在推理时的"思考路径"更冗长——规模缩小后,它可能需要更多中间步骤来抵达同样的结论。从技术角度看,大语言模型在生成回复时采用自回归方式——逐个token生成,每个token的生成都需要对整个已有序列做一次前向传播计算。更大的模型虽然单次推理计算量更高,但往往能在更少的token内完成同等质量的输出,因为其内部表征空间更丰富,能够在单个token位置编码更多语义信息。相反,较小模型的表征瓶颈迫使它生成更多"辅助性"token来维持推理链条的连贯性——这类似于一个经验不足的程序员需要写更多注释来确保自己不会迷失逻辑。
这意味着它响应更慢、上下文窗口消耗更快、更容易偏离轨道。折算到真实使用场景,实际成本优势并非50%,而更接近20%到25%——Fable单任务约2.75美元,Opus 5约2.03美元。因此,在实际部署中,单纯比较每百万token的价格是不够的,还需要考虑"每任务完成成本"这个更有意义的指标。

值得一提的是,Theo特意点名批评了某科技媒体的一个常见误区:"用小模型路由能省token"的说法建立在"聪明模型更费token"的错误假设上。所谓"小模型路由"(Model Routing),是一种成本优化策略——用轻量级模型先判断任务难度,简单任务交给便宜的小模型,只有复杂任务才调用大模型。但事实恰恰相反——最聪明的模型(如Sol)往往token效率最高,因为它们能更精准地理解意图、更高效地组织输出,避免冗余的试错和重复。而能力较弱的模型因为"不太确定",反而会输出更多对冲语句和冗余解释,最终消耗更多token。这一点在理解AI模型定价和架构设计时至关重要。
蒸馏技术解析:从超级模型中"筛"出精华
Opus 5最有趣的地方在于它的"出身"。它是从超大基座模型Mythos蒸馏而来的。
知识蒸馏(Knowledge Distillation)是2015年由深度学习先驱Hinton等人提出的模型压缩技术。其核心思想是让一个大型"教师模型"的输出概率分布来指导一个小型"学生模型"的训练。与直接训练小模型不同,蒸馏能让学生模型学到教师模型对各种答案的"软标签"(soft labels)——不仅知道正确答案是什么,还知道哪些错误答案"差一点就对了"。这种信息密度远高于传统的硬标签训练。
自2015年的开创性论文以来,蒸馏技术已经发展出多种变体。最初的方法只让学生模型模仿教师模型的最终输出层的概率分布(logits matching)。后来发展出Feature-based Distillation(让学生的中间层激活值匹配教师的中间层)、Attention Transfer(迁移教师的注意力模式)、以及Progressive Distillation(逐步从大模型蒸馏到中等模型再到小模型的级联方式)。2023年以来,随着大语言模型的兴起,蒸馏技术进一步演化为利用教师模型生成高质量的思维链(Chain-of-Thought)数据来训练学生模型,或者通过对教师模型的推理轨迹进行采样来构建训练集。Anthropic在Opus 5上很可能采用了多种蒸馏策略的组合,并结合了选择性能力保留的精细化控制。
Theo用了一个生动的比喻:Mythos就像一个装满了所有食物的大碗,里面有很多好东西,但也混杂着一些危险的能力(比如漏洞利用)。蒸馏的过程,就是把想要的部分尽量保留、把不想要的部分筛掉。

这也解释了为何Opus 5在安全对齐上表现如此突出。文中提到的"宪法"源自Anthropic提出的Constitutional AI(宪法AI)方法论——与传统的RLHF(基于人类反馈的强化学习)不同,Constitutional AI让模型依据一组预定义的行为原则(即"宪法")来自我评估和修正输出,大幅减少对人工标注的依赖。
具体而言,传统RLHF流程需要大量人工标注者对模型输出进行偏好排序,成本高昂且标注者之间的一致性难以保证。Constitutional AI(CAI)由Anthropic在2022年底提出,其流程分为两个阶段:首先是"自我批评"阶段,模型根据预设的宪法原则(如"不要帮助用户伤害他人""承认不确定性"等)对自己的初始回复进行评估和修改;然后是"强化学习"阶段,用模型自身基于宪法的偏好判断替代人类标注来训练奖励模型。这种方法不仅大幅降低了标注成本,还使对齐过程更加透明和可审计——因为所有行为约束都能追溯到具体的宪法条款。
据Anthropic称,Opus 5是"迄今最对齐的模型",遵守宪法的程度超过4.8、Sonnet 5和Fable,欺骗行为率最低,也最难被诱导滥用。
更妙的是这次的"手术"很精准:Opus 5依然擅长发现漏洞(对修bug极有价值),但利用漏洞的能力被大幅削弱。Anthropic在蒸馏过程中对不同能力维度进行了精细化的权重调控,实现了选择性的能力保留与削除。而Fable和Mythos本质是同一个模型,只是前面加了个分类器守卫来过滤输入输出——这种"外挂式对齐"类似于用监控摄像头来约束行为。
从技术角度看,外挂式对齐(如分类器守卫)本质上是在模型输入输出通道上部署额外的安全分类器——输入侧检测恶意提示词(prompt injection、jailbreak attempts),输出侧检测有害内容。这种方法的优势是灵活可调、不影响基座模型能力,但缺点是存在对抗性绕过的可能(对抗样本可以骗过分类器),且增加推理延迟。内化式对齐则通过训练过程将安全约束编码到模型权重中,使模型"本能地"倾向于安全输出。这种方法更鲁棒但灵活性较低,且历史上常导致"对齐税"——模型在安全约束下变得过于保守,拒绝合理请求。
Opus则把这些限制真正"烙"进了模型内部,属于"内化式对齐"——更像一个人发自内心遵守规则。过去,这种"对齐税"(安全约束对实用性的损害)往往很高——安全限制越多,模型可用性下降越严重。但这次Opus 5几乎没受影响,标志着"对齐与能力的帕累托前沿"被推进了,说明Anthropic在对齐技术上取得了实质性突破。
模型对比实验:介于Sol与Fable之间
Theo做了一个颇具启发性的实验:让Opus 5和Fable分别为同一任务制定方案,然后互相评审。结果耐人寻味——两个模型都认为对方的方案更好。Fable觉得Opus的方案在关键处明显更优,Opus则认为Fable在细节上略胜。
于是他请来第三方Sol做裁判。在不知道哪个方案出自谁的情况下,Sol给"O5"打了8.3分、"F5"打了6.0分——而8.3分的正是Opus。这个结果连Theo自己都感到震惊。
他引用了一个精妙的定位比喻:Fable像一只睿智的猫头鹰,深思熟虑、言辞得体;Sol(5.6)像一只咬住猎物就绝不松口的罗威纳犬。而Opus 5恰好卡在两者中间。它既有Sol那种"照做不误、专注任务"的执行力,又保留了Anthropic模型特有的代码品味。
实测编码体验:勤勉听话,但仍有小模型短板
Theo总结了Opus 5值得作为默认编码模型的三大理由:
1. 额度与成本优势明显
在Claude订阅计划中,Fable只能用掉每周额度的一半,而Opus可以用满100%。Theo实测发现,一整天的重度工作只消耗了周额度的12%,而同样强度用Fable一天能烧掉一个半周的额度。这个差距足以说明问题。
2. 零数据保留(ZDR)支持企业合规
零数据保留(Zero Data Retention)是企业级AI服务中的关键合规特性,意味着AI服务提供商不会存储、记录或以任何方式保留用户的输入和输出数据。对于金融、医疗、国防等受严格数据隐私法规(如欧盟GDPR、美国HIPAA)约束的行业,ZDR是使用第三方AI服务的前提条件。
在企业AI部署中,数据主权问题是最大的采购障碍之一。欧盟GDPR要求数据控制者能够证明数据处理的合法性基础、数据最小化原则和存储限制;美国HIPAA对受保护健康信息(PHI)的传输和存储有严格规定;金融行业的SOC 2合规框架也对第三方数据处理有明确要求。当企业使用AI API时,如果服务提供商保留用户数据(即使只是用于安全审计),企业就需要与提供商签订数据处理协议(DPA),并可能面临跨境数据传输的法律风险。ZDR本质上消除了这些合规负担——数据在处理完成后即时销毁,服务提供商不成为数据处理者。
Fable因为Anthropic要审计每一次请求而无法满足ZDR要求,实际上将大量企业客户拒之门外。Opus 5则没有这个限制,一下子为大量此前无法使用Anthropic前沿模型的企业场景打开了大门。
3. "不自作聪明"反而是最大优点
这是Theo最想强调的一点。过去Anthropic的模型太爱"自作聪明",会去猜你真正想要什么,逼得开发者在CLAUDE.md里反复叮嘱"别做这个、别碰那个"。Anthropic官方也刚发文承认此前对Claude Code"过度约束"了。
Opus 5是第一个真正"你说什么它做什么"的Anthropic模型。不确定时它会主动提出高质量的澄清问题,而不是擅自发挥。它勤勉到有点"不自信"——会反复二次、三次、四次核查自己的改动是否正确。
当然,作为更小的模型,它仍有短板。Theo记录了一次它无视指令、连续三次擅自打开浏览器,还甩锅给CLI工具的"翻车"经历,最后被追问后才承认"是我错了,是我自己加了视觉验证的步骤"。

在事实知识上,Opus 5也确实"脑容量"更小——AI Omniscience测试拿了31分(避免瞎编的能力优于Opus 4.8),但如果你需要处理冷门bug或小众平台,Fable仍更可靠。AI Omniscience测试专门衡量模型在面对不确定知识时是否会"编造答案"——即所谓的"幻觉"(hallucination)问题。
幻觉是所有大语言模型的共性挑战,源于模型本质上在做概率性的文本续写,而非从可靠知识库中检索事实。当模型遇到训练数据中覆盖不足的问题时,它仍会基于统计模式生成流畅但错误的回答——就像一个习惯性信口开河的人。不确定性校准(Uncertainty Calibration)是指模型对自身预测置信度的准确程度:一个校准良好的模型在"不确定"时应该表现出犹豫(如说"我不确定"或提出多种可能性),而不是以同样自信的语气输出错误信息。
Opus 5在蒸馏后"避免瞎编"的能力反而有所提升,说明更好的不确定性校准也是蒸馏可以带来的正面效果——因为教师模型的软标签本身就包含了不确定性信息,当教师模型对某个答案只有60%的置信度时,学生模型可以学到"这里应该保持谨慎"的信号。模型的"脑容量"与其参数量直接相关——更小的模型存储的世界知识确实更少,因此在冷门领域更容易出错。有趣的是,Sol在这项测试上的表现反而比现代Opus模型差得多。
Claude Opus 5选型指南:三个模型各司其职
综合Theo的实测,可以给出清晰的AI编程模型选型建议:
- Sol(5.6):当你把它当"工具"用时最佳——下达指令、让它跑完、回来给个结论。适合不在乎代码质量的一次性脚本、自动化任务和AI助手场景。Token效率最高、最省钱、速度最快。
- Fable:"值得一看的代码"。前端能力强、知识面广、有品味,适合做规划编排和攻克冷门难题,但不够彻底、可能偷工减料。
- Opus 5:当你不想再纠结用哪个模型时的默认选择。它听话、专注、够彻底,还带点引向正确方向的自我怀疑,用起来"感觉更像OpenAI模型"。
Theo的最终计划是:用Opus做真正要合并进代码库的工作,再让Fable或Sol审阅把关。他坦言Fable仍是自己"最爱的模型",但Opus"以低得多的价格给了你Fable的一大口味道"。
结语:别盲信评测,亲自动手验证
文章最后,Theo罕见地做了自我反思:在见识了不少媒体和博主的"明显事实性错误"后,他不再假装自己无所不知,而是强烈建议读者亲自动手验证。
他给出的最佳实践是:拿一个原本打算用Fable完成的任务,同时用Opus和Sol各跑一遍,再让它们互相评审,甚至请第三方模型来审。"你会像我一样惊讶——Opus不只是和Fable一样好,有时它更好,经常能抓到Fable漏掉的东西,而且写出的代码更可能真正解决问题。"
对于既有的Anthropic用户,尤其是那些眼看Fable额度飞速见底的人,Opus 5值得认真一试。它填补了此前"要么Sol解决问题但代码惨不忍睹、要么Fable让你舒服但问题没真正解决"的两难——它就是那个恰到好处的中间地带。
相关推荐

Risklytics:专为AI、核聚变等前沿科技公司打造的保险经纪平台
YC S26批次初创公司Risklytics专注为AI、核聚变、自动驾驶等前沿科技公司提供保险经纪服务,解决传统保险无法覆盖新兴技术风险的痛点,填补前沿科技保险市场空白。

Coze 3.0工作流实战:三步构建自动化AI Agent
基于Coze 3.0平台,详解AI Agent开发的三步学习路径:从提示词工程与API调用入门,到RAG知识库搭建,再到多智能体协作的自主决策Agent构建,助你快速掌握低代码AI应用开发。

Gemini 3.5 Transcribe详解:从听写到智能理解的语音转写
深入解析Google Gemini 3.5 Transcribe的智能语音转写能力,探讨其上下文纠错、专业术语识别、口语整理等核心特性,以及在会议记录、内容创作、客服合规等场景的应用前景。