每日AI新鲜事·09月16日早间版:Jev模型造价与AI墓地
每日AI新鲜事·09月16日早间版:Jev模型造价与AI墓地
2026年09月16日(周三)早间版 AI新闻速递+热点深度讨论
2026年09月16日(周三)早间版 AI新闻速递+热点深度讨论
今天AI圈新消息不少, 而且有几条挺有意思的. 先说一个让我眼睛一亮的, HN上突然冒出来一个叫Jev的新前沿模型, 号称比现有顶级模型便宜四十到四百倍, 还快二十到两百倍.
这个数字我看完第一反应是, 这不是在吹牛吗? 区间跨这么大, 四十倍到四百倍, 差了整整十倍的幅度.
你这个怀疑是对的, 小雨. 这种大区间数字在技术圈很常见, 背后通常意味着它的基线选得很讲究, 或者测试条件非常特殊.
不过我觉得核心论点倒不是完全没道理. Jev背后的公司Typesafe AI在文章里说了一个观点, 就是现在AI部署的最大瓶颈已经不是模型能力, 而是成本和延迟.
你想啊, 低延迟才能做语音交互, 才能做实时代码补全, 才能撑起Agent系统. 这个方向本身是对的. 从技术路线猜, 大概是MoE加上投机解码, 再配合量化和垂直方向专项调优.
等一下, 你说垂直专项调优, 这是不是意味着它在通用任务上可能就不行了? 便宜是有代价的?
大概率是的. 所以HN上的程序员们普遍态度是, 先别信营销数字, 拿自己的真实任务跑一遍再说. 这个建议我觉得非常正确.
但有一点值得肯定, 这家公司把话说死了, 白纸黑字. 后续如果跑出来的数据打脸, 那是要还的. 这比很多只说「最先进」不给具体数字的公司要好一点.
行吧, 留个眼神观察一下. 然后说第二条, 这条我觉得挺扎心的. TechCrunch搞了一份AI项目墓地清单, 专门盘那些关闭的, 延期的, 没达预期的AI项目.
里面提到苹果Siri反复跳票这件事. 把前沿大模型稳定整合进消费级产品, 难度远比外界想象的大.
这个墓地清单总结出三条死亡路径, 我觉得归纳得挺准的. 第一是期望管理失控, 用户信任崩掉. 第二是商业模式模糊, 撑不住算力成本. 第三是基础模型商品化之后, 小型AI产品被直接挤出市场.
第三条最残忍. 你辛苦做了一年的套壳工具, 结果OpenAI或者Anthropic直接把这个功能内置了.
对, 所以这份清单对创业者来说是个很好的反面教材. 不过我注意到里面还提了OpenAI超级应用发布混乱这件事, 说明技术领先不等于产品成功. 这个观点我完全同意.
好, 然后还有一条我必须带一下, 关于数据中心能耗. TechCrunch报道说, 到二零三五年, 美国数据中心消耗的天然气可能超过德国和日本加起来的总量.
这个数字很震撼. 根本原因是AI计算需要全天候稳定供电, 风能太阳能间歇性太强, 天然气灵活、建设周期短, 就成了首选的过渡方案.
可是这就跟各大科技公司喊的净零目标直接撞车了啊. 一边说碳中和, 一边大量烧天然气.
撞车撞得很厉害. 小型核反应堆商业化和电网级储能是长期解法, 但近几年都顶不上去. 所以这个矛盾短期内没有好答案.
最后一条安全相关的. 一个安全研究团队对AI基础设施公司Baseten做了渗透测试, 二十五分钟就拿到了人家生产环境GitHub的管理员权限.
这个细节是关键, 二十五分钟用的不是什么高精尖漏洞. 就是凭据泄露, 权限配置太松, 加上OAuth滥用. 最基础的防线没守住.
拿到GitHub管理员权限意味着什么? 普通用户可能感受不到这有多严重.
意味着可以偷部署密钥, 可以改CI/CD流水线, 然后风险会传导到所有下游客户. 攻击面直接乘以N倍. 这篇文章最后给出了防御清单, 核心就是最小权限, 短期凭据, 定期审计第三方应用.
而且文章特别提了一点, 供应链安全要和模型安全放在同等优先级. AI圈现在很多人只盯着模型, 忽略了基础设施这层.
对, 这也是成熟度的问题. AI公司普遍工程安全意识还没跟上业务扩张的速度.
好了新闻先聊到这儿. 接下来我们聊聊最近B站上特别火的一个话题, 就是Qwen3.8系列的各种骚操作.
B站上好几个Qwen3.8的视频互动分都破了三万五千, 其中一个低显存使用方案的视频更是到了六万七千多. 这个热度放在技术类内容里真的不低了.
我觉得这件事有意思的地方不只是热度本身. 小雨你注意这些视频在讲什么, 都是在解决一个具体的痛点, 就是怎么在本地跑得起来, 跑得快, 还不损失太多能力.
对, 还有一个视频是专门讲「赛博治疗」的, 调Qwen3.8-27B的思考深度, 让它想得少一点但不掉能力, 还不死循环. 这个标题我觉得起得绝了.
这个问题背后其实是个真实的工程挑战. Qwen3系列有个thinking模式, 开启之后模型会先大量内部推理再输出. 推理质量确实高, 但token消耗暴涨, 延迟也上去了.
所以这些视频在做的事情, 本质上是在寻找一个甜点区, 就是思考深度够用就好, 不要过度思考. 这个需求在本地部署场景里特别普遍.
你这么说我理解了. 那UD3.0量化是什么? 视频标题里提到了.
量化是把模型权重从高精度压缩到低精度的技术. 简单说就是用更少的比特表示同样的参数, 显存占用直接下来. UD3.0是llama.cpp体系里一个比较新的量化方案, 在同等压缩率下精度损失控制得更好.
所以这些视频的核心就是, 显存不够的人怎么让27B参数的模型跑起来?
对, 而且不只是跑起来, 还要跑得有意义. 量化+思考深度控制+特调权重, 这三件事组合起来, 才能在显存受限的机器上真正可用.
不对吧李博, 我有个疑问. 如果要折腾这么多, 为什么不直接用小一点的模型? 比如8B或者14B, 不就不用这么麻烦了?
好问题. 因为27B在推理任务上有个很明显的能力跳跃. 很多稍复杂一点的问题, 8B就是答不好, 14B勉强, 27B才能稳. 所以有人宁愿折腾, 也要把27B塞进显存里.
这个现象背后还有个更深的逻辑. 这两年模型能力确实够强了, 大家开始愿意花时间在部署和效率上做文章. 以前大家追的是能力, 现在追的是怎么在我的硬件上跑起来.
这个转变我能感受到. 而且B站的技术内容能破这么高的互动, 也说明这不只是少数极客在折腾, 是真的有一大批人在本地部署这件事上卡住了.
对, 这是一个很健康的信号. 用户群在往纵深走, 不再满足于云端API调用, 开始想要自己控制整个推理环节.
还有一个视频是关于codingplan订阅套餐推荐的, 互动分将近一万五. 这个我理解是AI编程工具的付费方案比较类?
是的. 现在AI编程工具已经有Cursor, Windsurf, Augment这些选手, 再加上Claude Code, 每家定价和套餐都不一样. 怎么搭配性价比最高, 这个问题对重度用户来说真的是个实际问题.
这类内容能火起来, 我觉得有一点很重要. 就是AI编程工具的月费加起来真的不便宜. 比如有人同时订了好几个, 一个月可能花出去好几百块甚至更多.
你这么说我突然想到一个问题, 这些工具的按量计费逻辑和传统SaaS很不一样. 因为用量是波动的, 写代码的时候可能爆用, 不写的时候可能完全闲置, 怎么选套餐确实需要策略.
所以这类内容本质上是帮人省钱. 难怪有这么多人看.
而且这背后还有个大趋势. AI编程工具已经从少数极客工具变成日常开发标配了. 能出现订阅攻略这种视频, 说明这个市场真的到了一个新阶段.
好, 拉回来总结一下今天B站这波热度. 我觉得核心就是一句话, 模型能力已经不是瓶颈了, 大家现在最关心的是怎么把它跑起来, 跑得便宜, 跑得快.
对, 所以结论是, 推理效率这条线现在是最热的实战方向. 不管是量化, 思考深度控制, 还是订阅套餐选择, 都是在同一个大命题下的不同切面. 这个趋势接下来只会更明显.
行, 今天就聊这些, 信息量不少. 大家消化一下, 我们中午见.
相关推荐
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。