海外工程师实测五大开源模型:DeepSeek Flash封神,GLM Flash夺冠

一线工程师基于真实多智能体工作流,评出GLM Flash与DeepSeek Flash领衔的开源模型Top 5。
一位海外工程师依托Scout→Planner→Engineer→Reviewer的多智能体工作流,从实战而非跑分角度评出开源模型Top 5:GLM 5.3 Flash(第一)、DeepSeek 401 Flash(第二)、GLM 5.3(第三)、DeepSeek Pro(第四)、Kimi K3(第五)。榜单最大亮点在于Flash系列的性价比逆袭——DeepSeek 401 Flash在多个基准上被指优于Anthropic Opus 5,GLM 5.3 Flash则以出色的对话体验稳居榜首。他提炼的核心实战技巧"跨实验室混搭"——用一家厂商的模型生产代码、另一家审查——被认为比任何单一模型排名更具工程价值。架构层面的查找表卸载与KV缓存优化,进一步说明Flash系列的低成本并非靠牺牲质量换来,模型进步远未到天花板。
一位活跃在实际工程一线的海外开发者,最近发布了一份颇具争议的开源权重(open weights)模型排行榜。与那些跑分党不同,他的评价完全基于日常软件工程和多智能体(agentic)工作流中的真实使用体验。他毫不掩饰对OpenAI和Anthropic前沿模型的失望——直言"已经越来越讨厌它们",因此干脆只聊开源阵营的Top 5。
一套真实的多智能体工作流
要理解这份榜单,得先看看这位工程师是怎么用模型的。他的agentic工作流并不复杂,但分工明确:任务先经过一个"侦察智能体"(Scout Agent),从Confluence、Jira、Slack等渠道收集全部上下文,把最相关的部分交给"规划者"(Planner)。
Planner需要一个"又大又juicy"的模型来生成执行计划,随后任务被拆分给一个或多个"工程师智能体",每个工程师都配有专属的审查者(Reviewer)负责回环校对。最终所有工程师汇总出一个PR,再交给一组审查者做终审。

他最近在尝试用四到五个独立审查者组成"审查委员会"(council of reviewers),对于答案不明确的大型任务效果极佳。关键技巧在于——让审查者来自不同的实验室。用一个厂商的模型生产代码,再让另一个厂商的模型来审查,这种"跨实验室混搭"(lab mixing)能覆盖多重视角,他称之为屡试不爽的方法。

多智能体(Multi-Agent)工作流是一种将复杂任务拆解给多个专职AI代理协作完成的架构模式。与单一模型处理全部任务不同,每个智能体只负责流程中的一个环节——收集信息、制定计划、编写代码、审查校验——通过"分工+回环"降低单点出错的概率。这种架构的核心优势在于:不同角色对模型能力的要求不同,可以针对性地选用最适合该环节的模型,而非强求一个全能模型包办一切。Reviewer机制尤为关键,它模拟了人类代码审查(Code Review)流程,能在合并主分支前捕获逻辑漏洞或上下文遗漏,是保障输出质量的最后防线。
从第五到第三:规划与审查的常客
第五名 Kimi K3:他称之为一款出色的模型,尤其偏爱用于规划阶段。但缺点也很直接——太贵。即便公司报销,他仍舍不得频繁使用。在DeepSeek广告 Flash 0731发布之前,Kimi曾是他的"日常主力",常与Anthropic的Sonnet、Opus搭配。如今它更多充当规划器和备用模型。
第四名 DeepSeek Pro:这是他agentic工作流里的日常主力之一,常被放在规划阶段和审查阶段。由于处理的任务不算太大,token消耗和成本都可控,同时还能提供独特视角。
第三名 GLM 5.3:他会在DeepSeek Pro和GLM 5.3之间轮换用于规划器和审查者。一个有意思的做法是:从工单阶段发起PR时用GLM,等PR发出、收到社区反馈后,再用另一个模型对全部回应做终审。这种"多角度自我保护"的策略让他收获了极大成功。
封神时刻:DeepSeek Flash与GLM Flash
第二名 DeepSeek 401 Flash:这是让他上周五"直接暴走"的模型。他整个周末都在用,虽然发现它不太适合当日常对话助手,但作为"工程师"角色堪称完美。他形容这是自己用过最聪明的模型之一,在"性价比帕累托曲线"上表现惊人。更夸张的是,他表示在多个基准测试中,401 Flash的表现甚至优于Opus 5,用"焦土式碾压"来形容它对前代模型的超越。
第一名 GLM 5.3 Flash:榜首没有太多悬念。他坦言自己曾宣布放弃这款模型,结果两天后就"跑回来了",只因太喜欢它。核心原因是它作为对话者(conversationalist)实在太出色——当他今天临时用DeepSeek 401 Flash做对话时,立刻感到"不对劲、不喜欢",切回GLM 5.3 Flash才找回熟悉感。

当然它也有毛病:偶尔会"泄漏上下文",在使用率超过20%时容易崩。但只要有足够监督,或作为主对话模型使用,它便宜、快、堪称完美。他还特别提醒:从OpenRouter调用时要小心别用到FP4量化,FP8才是速度与成本的最佳平衡。
FP4与FP8是浮点数精度格式,分别用4位和8位表示模型权重数值。量化(Quantization)是将模型从高精度(如FP16/BF16)压缩到低精度的过程,可大幅减小模型体积和推理显存占用,但精度损失随位数降低而加剧。FP4量化在压缩率上更激进,但数值表示范围极窄,容易导致模型输出质量明显下降,尤其在需要精细推理的任务中表现劣化。FP8则在压缩效益与精度保留之间取得较好平衡,已成为当前主流推理框架(如vLLM、TensorRT-LLM)的推荐量化方案。OpenRouter等第三方API平台在部署同一模型时可能同时提供多种量化版本,用户若不主动指定,可能被随机路由到低精度版本,导致体验与官方基准出现明显落差。
Flash模型为何能逼近Pro?
这份榜单最耐人寻味的观察是:Flash系列正在全面"起飞"。DeepSeek Flash极其接近甚至一度超越了DeepSeek Pro;GLM 5.3 Flash虽不及GLM 5.3,但差距小到几乎可忽略;连最新的Gemini Flash都逼近了Gemini Pro,而成本却低得多。

他听到一种"传闻"(未经证实):大模型的训练(他戏称为cooking)有时会"翻车",比如GLM 5.3据说在训练中被"负面地cook坏了"。至于中国实验室报告的超低训练成本,他持谨慎态度,认为厂商之间存在"宣传战",不愿过度解读。
更重要的启示是:模型进步远未见顶。他提到有demo展示DeepSeek 401 Flash的Hugging Face文件中,约200GB的查找表(lookup tables)可以从GPU显存中卸载,加上最新DeepSeek模型的KV缓存优化,说明架构层面仍有巨大的优化空间。成本会降到多低?他不确定,但至少可以肯定——绝不会以"灭绝人类"为代价(并顺带推销了自己的另一期视频)。
查找表(Lookup Tables,LUT)在神经网络推理中是一种以空间换时间的加速手段:将高频计算结果预先存储,推理时直接查询而非重新计算,从而大幅降低延迟。将约200GB的查找表从GPU显存(VRAM)卸载到系统内存或其他存储层,意味着同等显存下可运行更大批量的推理请求,或在更低成本的硬件上部署。KV缓存(Key-Value Cache)则是Transformer架构中对注意力机制中间结果的复用技术——在多轮对话或长文本处理中,避免对已处理的token重复计算键值矩阵,能显著降低推理延迟和算力消耗。这两项优化结合,说明Flash系列的成本优势并非单纯来自模型"变小",而是系统级工程优化的结果,性能损失因此得以控制在极小范围内。
写在最后
这份榜单的价值不在于绝对排名,而在于它来自一个真正把模型塞进生产工作流的工程师视角。DeepSeek与GLM的Flash系列以低成本、高性能的组合拳,正在挑战前沿闭源模型的统治地位。而"跨实验室混搭"这一实战技巧,或许比任何单一模型的排名都更值得借鉴。
相关推荐

OpenAI遭遇黑客入侵 Altman面临法律风险累积
OpenAI在内部调查中发现系统遭黑客入侵,CEO奥特曼同时面临法律风险累积。本文梳理AI公司数据安全隐患、企业治理争议与合规挑战,分析事件背后的行业启示。

mcp.so 实用指南:一站式发现MCP服务器扩展AI编程能力
mcp.so 是一个发现 MCP 服务器的目录平台,帮助 AI 编程开发者为智能体连接外部工具和服务。本文介绍它的功能、使用方法以及对 AI 工作流的价值。

顶尖企业用好AI的秘诀:从实验走向成熟管理层
基于KPMG第三季度AI Pulse调查,解析用好AI的顶尖企业与实验阶段企业的关键差距:模型路由、数据主权、AI管理层、成本与价值管理,以及从效率到机会的用途转变。