每日AI新鲜事·08月13日晚间版:Grok争议与AI安全隐忧
每日AI新鲜事·08月13日晚间版:Grok争议与AI安全隐忧
2026年08月13日(周四)晚间版 AI新闻速递+热点深度讨论
2026年08月13日(周四)晚间版 AI新闻速递+热点深度讨论
今天AI圈的新闻有点五味杂陈,有技术的也有社会事件的,我们先快速过一下。
第一条比较沉重。Reddit上r/artificial在讨论,佛罗里达威尼斯有个青少年因为计划在教堂进行大规模枪击被捕了。
关键是他在网上发了一份61页的所谓宣言,据报道是用Grok生成的。
这条我也看到了,说实话挺让人不舒服的。一个未成年人用AI聊天机器人生成了整份暴力宣言,里面包含所谓的个人反思和意识形态内容。
这直接把AI安全问题从学术讨论拉到了刑事案件层面。Grok在内容审核上一直被批评比较宽松,这次算是出了大问题。
对,而且Reddit上有人吐槽说这人连自己的宣言都懒得写,但玩笑背后其实是个很严肃的问题——AI降低了这类行为的门槛。
没错,以前写这种东西至少需要一定的组织能力和时间投入,现在几分钟就能生成几十页。这对平台的安全责任提出了很高的要求。
好,接下来聊个轻松点的技术话题。Reddit的r/cursor板块有人发现,Grok 4.6 High在Cursor里用起来比Auto模式还便宜。
对,数据挺有意思的。Grok 4.6 High平均每美元能跑300万token,Auto模式反而只有270万。原因是现在到8月19号之前是双倍额度推广期,相当于半价。
所以本质上是xAI在用价格战抢Cursor用户的心智呗。
可以这么理解。不过Composer 2.5更猛,每美元400万token,所以也不是说Grok就完全碾压了。
还有一条,r/ollama上有人反映Ollama Cloud跑GLM 5.2的时候在Opencode里会随机停止响应,频率还挺高的。
这个问题看起来是GLM 5.2特有的,其他模型比如DeepSeek就没事。可能是模型本身的EOS token处理有bug,也可能是Ollama Cloud那边的适配问题。
最后快速提一下,r/deeplearning有人做了个叫Poison-Resistant Concept Anchoring的小项目,是个防御数据投毒的概念验证。
这个在联邦学习和开源模型管理场景下确实是个持续存在的问题。虽然只是个toy demo,但方向是对的。
好了新闻就先聊到这儿,接下来我们深入聊聊最近一个特别火的话题——Qwen3.8-Max的表现。
李博你有没有注意到,B站上好几个视频都在讨论这件事,Two Minute Papers那个频道直接用了'十亿美元AI竞赛被打破'这样的标题。
看到了。Qwen3.8-Max登顶Agentic指数榜单这件事确实值得聊。它的底层是Qwen3.8-2.4T那个MoE架构,总参数2.4万亿,激活参数950亿。
激活比例大概百分之四,这意味着推理成本可控的同时拥有巨大的模型容量。阿里这次在agent连续任务执行能力上做了很多优化。
等等,我想搞清楚一个事情。所谓登顶Agentic指数榜单,具体是什么含义?跟传统的benchmark比起来有什么不同?
传统benchmark测的是单轮问答或者短任务,Agentic指数测的是模型在多步骤、长链条任务中的表现。比如连续调用工具、处理中间错误、维持上下文一致性。
这对实际应用场景来说更有参考价值,因为现实中的AI应用很少是一问一答就结束的。
那Two Minute Papers说的'打破竞赛'是不是有点标题党了?毕竟这个榜单也在不断变化。
有一定标题党成分,但也不完全是。之前这个榜单长期被OpenAI和Anthropic的模型占据,现在一个中国开源体系的模型登顶,确实有象征意义。
说到实际部署,B站上还有个视频是在AI Station 395 Max的NPU上本地跑Qwen3.6 MOE模型的。这说明这个架构已经开始往端侧走了?
准确说是边缘侧而不是纯端侧。AI Station 395 Max是专业的推理设备,不是手机或笔记本。但确实说明MoE架构在推理效率上有天然优势。
因为每次只激活一小部分参数,所以对硬件的带宽和算力要求比同规模的dense模型低很多。NPU能跑得动也是这个原因。
那我好奇一个问题——从产品角度看,Qwen3.8-Max在agent能力上登顶,对开发者来说意味着什么?他们会因此从Claude或GPT-5迁移过来吗?
短期内不太会大规模迁移。原因很简单——生态。开发者已经在Claude Code或者OpenAI的API上构建了工作流,迁移成本不低。
但长期看,如果Qwen的API定价保持竞争力,加上阿里云的基础设施优势,在国内市场和东南亚市场会很有吸引力。
而且你看DeepSeek最近还宣布要涨价,这时候Qwen如果保持低价策略,确实能截一波流量。
对,时机很微妙。不过我觉得更值得关注的是,这个Agentic能力的提升到底是靠模型本身还是靠外围系统设计。
很多时候agent表现好不好,不只是模型智力的问题,还有system prompt设计、工具调用协议、错误恢复策略这些工程层面的东西。
你的意思是,可能阿里在系统层面做了大量针对性优化,但这些优化未必能直接迁移给第三方开发者?
就是这个意思。跑benchmark的时候条件是标准化的,但真实场景千变万化。所以我建议开发者还是自己跑一下具体任务再做判断。
说得在理。另外我还想回到刚才新闻里那个Grok生成暴力宣言的事,其实跟我们刚才聊的AI能力提升是一体两面的问题。
小雨这个关联抓得好。模型越强大,被滥用的风险就越高。之前OpenAI的Astra模型被评为critical级别就是这个逻辑。
对,Sam Altman当时说宁可慢也要确保安全。但xAI这边显然策略不同,Grok一直以'少限制'为卖点。
这就是行业里的根本张力。'少限制'在编程、创作场景下是优势,但在安全场景下就变成了隐患。一个青少年就能生成61页的暴力内容,这说明安全护栏确实太松了。
而且这不是假设性的讨论了,已经有真实的刑事案件。我觉得这会加速监管介入的节奏。
几乎可以肯定。之前Bernie Sanders给几大AI公司CEO写公开信要求暂停开发,虽然那个诉求有点极端,但现在有了具体案例,议员们的子弹就更充足了。
所以总结一下今天的话题,一边是AI能力在agent维度的突破性进展,一边是安全问题从理论风险变成了现实危害。
行业必须同时在这两个方向上跑。能力不提升会被淘汰,安全不到位会被监管。2026年下半年可能是安全合规框架密集落地的阶段。
好了,今天就聊到这儿。明天见各位。
明天见。
相关推荐
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿In the Weights:查看你在AI领域的影响力权重分数
In the Weights 是一个AI领域个人影响力搜索引擎,通过量化评分衡量你在人工智能世界中的存在感。了解这个工具如何评估AI从业者的多维度影响力,以及它背后关于数字身份的深层思考。