[控场AI]
模型Bonsai 2 27B / Ternary Bonsai 2

Bonsai 2

PrismML发布的基于Qwen 3 27B的三元量化大语言模型,使用PQ2_0格式将模型压缩至约7.2GB,声称在Top-1指标上保留超过98%的FP16性能,专为低显存本地部署场景设计

时间轴 (近 90 天)

10月4日

Prism ML推出的Bonsai 2模型声称在不到8GB显存里保留270亿参数模型98%的性能

待验证50%
10月4日

基准平均分匹配不等于真实智能体工作中的匹配,压缩抹掉的智能在需要长程规划、自我检查和持续推进的场景暴露

待验证50%
10月4日

Prism ML白皮书报告Bonsai 2在TerminalBench 2.1上保留约76%、在SWE-bench Verified上约75%的原模型分数,这两项长链基准未计入98%平均值

待验证50%
10月4日

Bonsai 2在长链任务中出现原地打转行为,如ISS追踪器任务发起153次工具调用其中150次只是读/列/搜索文件,并曾将同一工具调用114次

待验证50%
10月4日

在六个真实长链agentic构建任务中,Qwen3-27B得35/60并交付可运行应用,而Bonsai 2全线崩溃,未产出任何可运行页面

待验证50%
10月4日

在关闭思考功能的简单任务和长上下文测试中,Bonsai 2与全精度Qwen3-27B表现几乎打成平手,98%承诺基本成立

待验证50%
10月4日

Bonsai 2宣称的98%评分是20项基准在思考功能开到最大强度时测得的平均值

待验证50%
10月4日

Bonsai采用三值量化,将每个权重压缩为-1、0或+1三个值,每128个权重共享一个缩放因子,每个权重约需1.7比特,比16位全精度小约9倍

待验证50%
10月4日

Bonsai 2采用从Qwen3-27B架构出发以三值约束为目标的完整重新训练,而非对已有权重做后期量化(post-training quantization)

待验证60%
10月4日

Bonsai 2是由Prism ML推出的三值量化大模型,以Qwen3-27B为底座重新训练,整个文件约6GB

待验证50%

还有 21 条时间轴事件

全部知识事实 (20)

待验证

Bonsai 2适合本地聊天助手、知识问答与信息查询、笔记本上单段代码级别的轻量编码帮助

60%
待验证

Bonsai 2采用从Qwen3-27B架构出发以三值约束为目标的完整重新训练,而非对已有权重做后期量化(post-training quantization)

60%
待验证

在关闭思考功能的简单任务和长上下文测试中,Bonsai 2与全精度Qwen3-27B表现几乎打成平手,98%承诺基本成立

50%
待验证

Bonsai采用三值量化,将每个权重压缩为-1、0或+1三个值,每128个权重共享一个缩放因子,每个权重约需1.7比特,比16位全精度小约9倍

50%
待验证

Bonsai 2宣称的98%评分是20项基准在思考功能开到最大强度时测得的平均值

50%
待验证

基准平均分匹配不等于真实智能体工作中的匹配,压缩抹掉的智能在需要长程规划、自我检查和持续推进的场景暴露

50%
待验证

Prism ML白皮书报告Bonsai 2在TerminalBench 2.1上保留约76%、在SWE-bench Verified上约75%的原模型分数,这两项长链基准未计入98%平均值

50%
待验证

Prism ML推出的Bonsai 2模型声称在不到8GB显存里保留270亿参数模型98%的性能

50%
待验证

Bonsai 2在长链任务中出现原地打转行为,如ISS追踪器任务发起153次工具调用其中150次只是读/列/搜索文件,并曾将同一工具调用114次

50%
待验证

在六个真实长链agentic构建任务中,Qwen3-27B得35/60并交付可运行应用,而Bonsai 2全线崩溃,未产出任何可运行页面

50%
待验证

在构建3D地球仪ISS追踪器的agentic任务中,完整Qwen模型搭建出可工作的追踪器,而Bonsai 2未能写出一行代码,并将完全相同的搜索重复执行了114次

50%
待验证

Bonsai 2是由Prism ML推出的三值量化大模型,以Qwen3-27B为底座重新训练,整个文件约6GB

50%
待验证

Bonsai 2将模型中每个权重量化为-1、0或+1三种取值,每个参数压缩到不足2比特

50%
待验证

Prism ML宣称Bonsai 2在激进压缩后仍保留原始Qwen模型98%的性能

50%
待验证

BitNet b1.58将权重限制为{-1, 0, +1}三种取值,与Bonsai 2的做法高度一致

50%
待验证

在YouTube创作者的实测中,Bonsai 2在短任务(单轮问答、对话、一次性问题)上几乎与完整尺寸Qwen模型打成平手

50%
待验证

Bonsai 2不适合长时间运行的智能体任务、需要多步规划和工具调用及状态保持的复杂工作流、对决策稳定性要求高的自动化流程

50%
待验证

单一的性能百分比具有误导性,号称保留98%性能的模型可能在特定任务类型上恰好落在损失的2%里,应在信任benchmark前用真实任务测试

50%
待验证

Bonsai 2可在普通MacBook等消费级笔记本上运行,降低了27B级模型本地推理的门槛

50%
待验证

PrismML的Ternary Bonsai 2基于Qwen3.8的27B模型做三值量化,获387万下载,语言模型从54G压到5.9G,缩小9.3倍,官方称保留FP16模型98.2%能力,14个思考基准平均84.78分

50%

来源文章