[控场AI]
· 4 分钟阅读· 2,133 字

Claude Opus 5.5 登陆 Perplexity Computer:性能与成本双优

Claude Opus 5.5 登陆 Perplexity Computer:性能与成本双优

Claude Opus 5.5成为Perplexity Computer标准档位,性能微增的同时单任务成本大降67.6%。

Perplexity宣布将Claude Opus 5.5设为其AI Agent产品Perplexity Computer的标准努力档位(Standard effort level)。根据Perplexity内部的WANDR基准测试,该模型得分0.610,单任务成本为$4.13,相较前代Claude Fable 5.1在性能上略有提升,但成本降幅高达67.6%——相当于将单任务开销压缩至原来的三分之一。这一组合使其具备了作为默认选项面向广泛用户的条件:既保持了Agent任务所需的多步推理与工具调用能力,又将大规模部署的经济门槛显著降低。这一趋势也印证了当前大模型竞争的核心转向:从单纯追求能力天花板,转向在能力达标前提下的推理成本优化。

Claude Opus 5.5 成为 Perplexity Computer 标准档位

Perplexity 宣布,Claude Opus 5.5 现已作为 Perplexity Computer 的 Standard effort level(标准努力档位) 上线。这意味着用户在使用 Perplexity Computer 处理任务时,将默认调用这一新版本的 Claude 模型作为主力推理引擎。

对于依赖 AI Agent 完成复杂任务的用户而言,模型的选择往往决定了任务完成的质量与成本上限。将 Opus 5.5 设为标准档位,反映出 Perplexity 对该模型在实际生产环境中综合表现的认可。

Claude Opus 5.5 登陆 Perplexity Computer

WANDR 基准测试:性能小幅领先,成本大幅下降

根据 Perplexity 公布的 WANDR 基准测试数据,Claude Opus 5.5 取得了 0.610 的得分,单任务成本为 $4.13。

与此前的 Claude Fable 5.1 相比,Opus 5.5 在得分上略有领先,但真正的亮点在于成本控制——单任务成本降低了 67.6%。这组数据揭示了一个对实际部署极具意义的趋势:新版本不仅没有牺牲能力,反而在保持甚至提升性能的同时,将运行开销压缩到了原来的三分之一左右。

为什么成本降幅比性能提升更值得关注

在当前的 AI Agent 落地场景中,任务往往需要多步推理、工具调用和长上下文处理,单次任务的 token 消耗可能非常可观。当模型被大规模用于自动化工作流时,单任务成本从 $12 级别降到 $4 级别,意味着同样的预算可以支撑近三倍的任务量。

这也是 Perplexity 敢于将其设为「标准档位」而非「高级档位」的底层逻辑:性能达标、成本可控,才能成为默认选项面向广泛用户。

AI Agent的成本结构与普通对话模型有显著不同。在单轮问答中,token消耗相对有限;但在Agent任务中,模型通常需要维持跨步骤的长上下文(包含任务历史、工具返回值和中间推理链),并在每个决策节点生成较长的思维链输出。以Anthropic的扩展思考(Extended Thinking)特性为例,模型会在输出最终答案前生成大量内部推理token,这部分消耗在复杂任务中可能占总成本的50%以上。因此,单任务成本从$12降至$4,背后可能涉及推理效率提升、token压缩策略优化,或模型架构层面的蒸馏改进,而非单纯降价——这对评估模型实际能力的变化同样具有参考意义。

WANDR 基准的意义

WANDR 是 Perplexity 用于评估 Agent 类任务表现的内部基准。与传统的问答或代码基准不同,这类基准更侧重于衡量模型在真实、多步骤任务链条中的实际完成能力,包括规划、执行与结果准确性。

0.610 的绝对分数说明当前的 Agent 任务仍有相当的提升空间,但在同类模型的横向对比中,Opus 5.5 展现出了更优的「性价比曲线」。对于希望在成本与质量之间取得平衡的团队来说,这是一个具有参考价值的信号。

WANDR(Web Agent Navigation and Decision Reasoning)类基准的设计逻辑与传统静态基准有本质区别。传统基准(如MMLU、HumanEval)通常测试模型的单次问答或代码生成能力,而Agent基准则模拟真实世界的操作序列:模型需要自主分解目标、调用浏览器或工具API、处理中间步骤的反馈,并最终完成端到端的任务验证。这类测试的难点在于错误会沿步骤链条累积——某一步骤的误判可能导致整个任务失败,因此0.610的得分并不意味着模型在60%的任务上"完全成功",实际的部分完成率与任务复杂度分布密切相关。正因如此,不同厂商的内部Agent基准之间横向对比意义有限,同一基准内的纵向迭代对比才是更可靠的参照维度。

对用户与行业的影响

对普通 Perplexity Computer 用户而言,这次更新意味着无需额外配置即可享受到更强、更省的模型能力。对整个行业而言,Opus 5.5 的「降本不降质」再次印证了大模型迭代的一个明确方向:单纯堆叠参数追求分数的时代正在过去,如何在保持能力的前提下压缩推理成本,正成为模型厂商竞争的关键战场。

需要说明的是,本文数据来源于 Perplexity 官方在社交平台发布的信息,WANDR 属于其内部基准,跨厂商的横向可比性有限,具体表现仍需在实际使用中验证。

小结

Claude Opus 5.5 作为标准档位登陆 Perplexity Computer,以 0.610 的 WANDR 得分和 $4.13 的单任务成本,实现了对前代 Claude Fable 5.1 的性能小幅超越和成本大幅优化。这既是模型能力迭代的体现,也反映出 AI Agent 落地过程中,成本效率正在成为核心考量。

分享:

相关推荐