16G显存实测:Ornith 35B vs Qwen 35B全方位对决

在本地大模型日益普及的今天,越来越多开发者希望在有限硬件条件下运行高质量的开源模型。近日,技术博主Luke(Luke's Dev Lab)用一台仅有16GB显存的机器,对两款热门的35B级别模型——Ornith 35B与Qwen 3.6 35B进行了全方位对决测试。本文将梳理这场耗时超过24小时的实测结果,看看在真实使用场景下哪款本地大模型更胜一筹。
两款模型背景
Ornith是Deep Reinforce AI推出的模型,在Gemma和Qwen 3.5的基础上进行了后训练(post-training)。所谓后训练,是指在基础预训练模型之上,通过有监督微调(SFT)、强化学习(RLHF/RLAIF)等手段进一步优化模型行为的技术。与从零预训练相比,后训练成本极低,却能显著改善模型的指令遵循能力、安全性和特定领域表现。Deep Reinforce AI在Gemma和Qwen基础上做后训练,本质上是站在巨人肩膀上——既利用了Google和阿里云在预训练阶段投入的巨量算力,又通过自己的后训练数据和强化学习策略赋予模型新的特性。这也是当前开源生态中小团队追赶大厂的主流技术路径。官方在Hugging Face上的基准测试相当激进,直接将其35B版本与Qwen 3.6 35B-A3B对比,声称在各维度均更胜一筹。
为了验证这一宣称,Luke下载了两款模型的Q4KM量化版本(均为Unsloth的GGUF格式),在llama.cpp上运行。量化(Quantization)是将模型权重从高精度浮点数(如FP16/BF16)压缩为低位整数表示的技术,以牺牲少量精度换取大幅降低的显存占用和更快的推理速度。Q4KM是llama.cpp生态中的一种4-bit混合精度量化方案,其中"K"代表K-quant分组量化策略,"M"代表Medium规格,在精度损失和压缩率之间取得较好平衡。GGUF(GPT-Generated Unified Format)则是llama.cpp项目定义的模型文件格式,整合了模型权重、分词器和元数据,便于跨平台部署。Unsloth团队对GGUF量化流程做了大量优化,其产出的量化模型普遍被社区认为质量可靠。两个量化版本存在细微差异,但由于同为Q4KM量化,测试基本可以视为公平对比。
测试系统配置为16GB显存加部分内存,Luke特意选择这套配置,因为它更贴近大多数普通用户的真实部署条件。完整测试套件跑完耗时超过24小时。
推理速度:Ornith略快一筹
性能测试主要考察两个阶段的Token吞吐速度:预填充(prefill,即读取提示词)和解码(decode,即生成输出)。

实测数据显示:
- 预填充阶段:Ornith速度接近每秒200个Token,比Qwen快约20个Token。
- 解码阶段:Ornith稳定在每秒43个Token,无论输出长度如何都保持稳定;Qwen的解码速度整体慢约10个Token。
综合来看,Ornith在推理速度上小幅领先。Luke推测这可能与激活参数数量有关。Qwen 3.6 35B-A3B采用混合专家(Mixture of Experts, MoE)架构,"A3B"代表激活参数约为30亿,而总参数规模为35B——模型由多个"专家"子网络组成,每次推理时门控网络动态选择其中少数几个专家激活,其余保持休眠,从而在拥有大容量知识库的同时将实际计算量控制在小模型水平。Ornith官方未明确标注激活参数规模,若其激活参数少于Qwen的3B,每生成一个Token所需的矩阵运算量更小,便能在相同硬件上跑出更高的Token/s。
长上下文:256K大海捞针双双满分
内存测试采用经典的**"大海捞针"(needle-in-haystack)**方法。这一测试方法由Greg Kamradt于2023年提出并迅速成为行业标准:用无关的"干草"文本填满模型上下文窗口,在特定位置植入一段关键信息"针",最后提问要求模型复述该信息。测试核心挑战在于随着上下文越长、关键信息越接近满上下文末尾,模型因注意力机制局限往往出现"遗忘"。本次测试将上下文填满至完整的256K,然后在5%、50%、75%、100%四个深度位置随机放入数据片段,让模型去检索,每个深度重复测试三次。
结果令人惊喜——两款模型表现完全一致,均取得93%的成绩。它们在75%深度以内的三次测试全部成功,仅在100%满上下文深度时各有一次失败。
对于本地部署的量化模型而言,能在256K超长上下文下保持如此高的检索准确率相当亮眼。两款模型在长文本处理能力上难分伯仲。
Agency工具调用:Qwen微弱胜出
Agency测试将模型置于模拟公司的沙盒环境,提供一系列可调用工具,考察模型能否理解任务、推理问题并将多个工具串联完成目标。
两款模型均得95分,唯一失败的都是最难的第13号任务——该任务要求构建工具链,实现没有直接兑换工具的美元到日元外币转换。
差异在于失败程度:
- Ornith:几乎没有找对方向,基本只回答了哪些货币对可用。
- Qwen:已找到所需工具链,但最后一步未能成功调用货币转换工具,转而自行换算数字,忽略了指定的专用工具。
Qwen在这一项上更接近目标,算是工具调用能力上的一个小胜。
HumanEval编程测试:过度思考成关键变量
OpenAI HumanEval是2021年发布的编程能力评估基准,包含164道手写Python函数补全题,通过实际执行代码来判定答案正确性(Pass@k指标),评估阶段实际运行代码验证正确性。

这一轮暴露了一个有趣现象——过度思考(Over-thinking)。这一问题源于新一代推理模型引入的"思考预算"(Thinking Budget)机制:模型在给出最终答案前可进行内部链式推理,但为控制计算成本设有推理Token数量上限,一旦耗尽预算便无法输出完整答案:
- Ornith:45道题未作答,很可能是思考预算耗尽。作答题目通过率高达97%,但按总题数计算最终得分70%。
- Qwen:仅29道题未答,作答通过率98%,总得分80%。
Luke分析认为,Ornith在Qwen和Gemma基础上训练,而Gemma比Qwen更"爱思考"。训练数据的"基因"会直接塑造模型的思维习惯——训练中的Gemma成分或许导致Ornith倾向于对简单题目也投入大量推理步骤,消耗思考预算,从而少答了不少题。这也揭示了后训练时数据混合比例对模型推理风格的深远影响。这一轮Qwen小胜,但差距不算悬殊。
编程实战挑战:各有胜负
沙堆物理模拟器
这个挑战要求模型从头实现沙子、水、墙、酸液等材质的物理模拟。

- Ornith:一次成功,视觉效果流畅、反应迅速,酸液能正确烧穿其他材质,表现堪称完美。
- Qwen:耗时明显更长,甚至撞到上下文限制需要压缩(提示3万Token超出32700可用Token),首次输出的水和酸液物理效果异常,经额外提示修复后才达到可用状态。
这一轮Ornith凭借一次通过的表现明显胜出。
地牢探险游戏
这个任务难度更高,要求模型自行实现地牢随机生成算法和**光线投射(raycasting)**功能,且不能调用现成框架。光线投射是一种经典的2.5D渲染技术,因1992年《德军总部3D》和1993年《毁灭战士》而广为人知:从玩家视点出发,向每个屏幕列方向投射虚拟光线,计算光线与墙壁的交点距离,再根据距离渲染不同高度的墙面切片,在2D地图上模拟出3D透视效果。要求模型从零实现这一算法,既考验对三角函数、DDA算法(数字差分分析器)的理解,又需要正确处理边界碰撞、视野角度等细节,是检验深度编程推理能力的高难度任务。

两款模型都遇到了不小的困难:
- Ornith:初版玩家无法移动、光线投射范围极小、没有地图,反复反馈后模型始终无法修复,直到它主动输出调试日志,Luke才得以协作定位问题,又经三轮左右迭代最终得到了不错的结果。
- Qwen:同样需要多次提示,但过程相对顺畅——依次补齐墙壁、战争迷雾、区域连通性,用较少几次提示就达到可玩状态。
值得一提的是,Ornith主动"输出日志排查问题"的行为,恰恰是成熟程序员面对Bug时的标准做法。这一轮双方基本打平,都需要多轮沟通才能完成。两款35B量化模型最终均能产出可玩版本,也印证了当前百亿参数量化模型在复杂算法实现上已具备相当的能力。
综合评测结论
综合全部测试,Luke的最终结论如下:
- 推理速度:Ornith略快(预填充快约20 Token,解码快约10 Token)
- 长上下文:完全平手,256K下均表现出色
- Agency工具调用:Qwen微弱领先
- HumanEval编程:Qwen胜出,主要优势在于避免了过度思考
- 沙堆物理模拟:Ornith胜出,一次通过
- 地牢探险游戏:打平
总体结论:Ornith基本上和Qwen一样好。 考虑到Ornith目前只是第一版模型,这个成绩相当值得肯定,未来仍有较大的进步空间。
对于16GB显存的普通用户来说,这场对决传递出一个积极信号:即便在消费级硬件上,量化后的35B级别本地大模型也已能胜任大部分编程、工具调用和长文本任务。Ornith的表现同时证明,基于Qwen和Gemma进行后训练的技术路线,确实能产出与原版旗鼓相当的竞争力模型。
Luke后续还将用这两款模型测试2D驾驶游戏、迷宫智能体等更多编程挑战,并计划评测Ornith的9B小型版本,感兴趣的读者可持续关注。
核心要点
相关推荐

Go微服务实战:商城、AI Agent与IM系统集成架构详解
深入解析Go微服务架构下商城、AI Agent与IM即时通讯系统的集成方案,涵盖统一鉴权、gRPC通信、组件化Agent引擎设计、群聊机器人等生产级落地场景,适合希望掌握存量系统集成能力的Go开发者。

X平台推荐算法被曝过滤巴西选举内容,算法透明度再引争议
X平台(原Twitter)被用户发现在For You推荐流中过滤巴西选举相关内容,引发算法透明度与言论自由争议。本文深入分析事件背景、技术实现方式及对平台治理的深层影响。

抗投毒概念锚定:防御AI数据污染的新思路
深入解析Poison-Resistant Concept Anchoring方案,通过签名锚点与有界更新机制防御数据投毒攻击。实验显示该方法可隔离62%投毒数据,同时保持0%正常数据误拦率,为联邦学习和开源模型协作提供可行的安全防御框架。