每日AI新鲜事·09月18日早间版:联合国牵手谷歌与微软训练数据丑闻
每日AI新鲜事·09月18日早间版:联合国牵手谷歌与微软训练数据丑闻
2026年09月18日(周五)早间版 AI新闻速递+热点深度讨论
2026年09月18日(周五)早间版 AI新闻速递+热点深度讨论
今天AI圈又有不少新消息, 联合国跟谷歌搞了个大动作, 微软还翻出了一堆内部丑事, 咱们赶紧过一遍.
第一条, 在TechCrunch上看到一篇报道, 联合国正式宣布跟谷歌合作, 要把全球数据整理成AI可以直接调用的状态.
起因很有意思. UNICEF做了一个测试, 让主流AI模型去查全球发展统计数据, 结果频繁出错. 原因是那些数据太分散了, 格式乱得一塌糊涂, 模型只能靠训练时记住的东西来回答.
这个问题我们在研究院经常遇到. 模型现在的状态就是在凭记忆作答, 而不是真的去查证. 联合国这个数据问题特别典型.
谷歌这次用的是Data Commons那套知识图谱技术, 把人口, 经济, 健康, 气候, SDGs这些数据全接到一个入口里, 支持自然语言查询. 技术路线上没什么新鲜的, 但规模和权威性不一样.
等一下, 你说技术不新鲜. 那这件事的意义到底在哪里? 是谷歌又拿到了一大块数据?
意义在于数据的公信力. 联合国的统计数据是全球公认的权威来源, 现在这些数据变成AI可以直接查的接口了, 就好比你原来只能靠印象回答问题, 现在身边放了一本随时查得到的百科全书.
更深层的趋势是, 数据的「可被AI使用性」开始变成机构数字化的核心指标了. 以前大家只要数据好看, 现在还得确保AI能正确读到它.
不过平台目前细节还没出来, 数据更新频率, API文档, 覆盖范围都是问号. 谷歌博客里写的也比较大而化之. 先观察吧.
好, 下一条. 这条就比较炸裂了. TechCrunch报道, 一批法庭解封文件显示, 微软内部高管曾把AI抓取训练数据这件事称为「人类史上最大规模的劳动盗窃」.
这个我看到了, 而且文件里还说微软和OpenAI从纽约时报付费墙后面抓了内容, 内部团队早就预警过这样做可能把出版商整垮.
最讽刺的是, 这两家公司对外一直在说「合理使用」, 内部说的完全是另一套. 这个落差才是原告方最有价值的证据.
对, 这不就是说一套做一套吗. 法律上「合理使用」本来就是个争议地带, 但现在有内部文件直接承认性质, 性质就变了.
对行业的影响我觉得也蛮大的. 如果这个判例下来, 后续内容授权协议可能真的会大规模普及. 那训练成本就不一样了.
对, 这触到了一个根本矛盾. 高质量数据是AI进步的命脉, 但内容创作者的权益也不能一直这样悬着. 这个裂缝迟早要在司法层面被填上.
然后还有一条, 来自Reddit的LocalLLaMA社区. 一个叫Jovan的开发者发了个帖子庆祝, 他的Swift Qwen3.8 27B在HuggingFace上破了十万次下载.
这个模型的核心创新是针对推理模型的「过度思考」问题. 简单说就是让模型思考得更高效, 而不只是思考得更短. 实测token用量降了百分之五十八, 推理速度快了将近两倍, 而且准确率没掉.
这个方向挺对的. 「过度思考」是推理模型现在的真实痛点. 模型会绕很多弯子才得出结论, 算力浪费很严重. 能在不掉分的情况下把token缩一半, 对实际部署太友好了.
而且社区贡献也功不可没. bartowski做了GGUF量化, 大家还推着他们加了代码和长任务的基准测试. 开源这种生态就很有意思.
最后快过一条, HackerNews上有人在聊密苏里州长发了行政命令, 要对Flock Safety那套自动车牌识别系统设护栏. 限制数据留存, 限制跨辖区共享.
Flock已经覆盖全美四千多个城市了, 这个规模确实让人坐不住. 不过这次不是全面禁止, 是建「使用护栏」. 这个监管思路代表了一种趋势, 从各地零散博弈到州级统一框架.
行, 对于AI监控领域的朋友可以关注一下. 好了新闻就先聊到这儿, 接下来我们深入聊一个最近挺火的话题.
最近YouTube和B站上有个话题被反复讨论, 就是怎么自己给AI模型做基准测试. 还有一个相关的, 是关于Google DeepMind的一些信息在流传. 我们把这两个串起来聊.
先说那个「自己跑基准测试」的话题. 有个视频专门在讲方法论, 为什么这件事现在变成了一个独立的话题?
原因很简单, 官方跑分越来越不可信了. 大家意识到, 厂商自己发的benchmark分数, 测试条件你根本看不到, 选题也可能有偏向. 所以想亲手验证.
而且现在模型迭代太快, 官方数据经常滞后. 你想知道某个模型在你自己的任务上表现怎么样, 只能自己测.
可是这就有个问题啊. 普通用户或者说中小团队, 没有那么多资源和精力去设计严谨的测试集. 自己测出来的结果可信吗?
你说的对. 自测最大的陷阱是「测了对自己有用的场景」, 然后得出一个不具备普遍性的结论. 比如有人测代码生成, 只测了Python, 就说这个模型代码能力强.
但我觉得这反而是这件事有价值的地方. 如果你就是做中文法律文书的, 你针对这个场景自己测出来的结论, 对你来说比任何官方榜单都准. 场景化测试比泛化测试更有用.
这么说我觉得挺有道理. 其实我们做产品的时候也是这样, 用户实际场景的表现才是判断依据, 不是实验室数据.
那你说说, 自己测的时候最容易踩哪几个坑?
第一个坑是测试集污染. 如果你用的题目是网上公开的, 很可能模型训练时见过. 第二个坑是评估主观化, 让模型输出自然语言然后靠感觉打分, 这个根本没法对比.
第三个坑就是你刚才提到的, 样本量不够. 测个二三十题就下结论, 误差太大了. 还有一个很多人忽视的, 就是prompt的一致性. 同一个问题, 换种问法得分可能差很多.
所以真要认真做, 还挺麻烦的. 难怪Swift Qwen这个项目里, 社区用户专门推着他们去加coding和长任务的测试, 大家对测试严谨性还是有要求的.
对. Swift Qwen那个案例挺典型的. 开发者自己发布了核心指标, 但社区不满足, 要更全面的测试覆盖. 这说明用户的测试素养在提升.
然后另一个话题, 就是那个关于Google DeepMind和GPT-6的流出信息. YouTube上有个分析视频, 在B站也有传播. 你怎么看这类信息?
先说结论. 这类「leak」视频要非常谨慎对待. 信息来源不透明, 很多时候是把公开资料和推测混在一起包装成爆料, 真实性存疑.
但这种视频流量就是高, 大家就是爱看. 为什么这类内容那么有市场?
因为模型竞争现在太白热化了. GPT-6什么时候出, Gemini下一代什么水平, 这些问题大家都急切想知道. 信息真空里, 任何片段都会被放大.
而且你看, 这跟刚才说的自测话题有个连接点. 大家一边追着leak信息, 一边开始学自己测. 本质上都是对厂商官方说法的不信任.
你这个角度挺有意思的. 用户主动测和追leak, 都是同一种不信任在驱动.
那你觉得这个不信任的根源是什么? 是厂商太不透明, 还是这个领域本来就难量化?
两个都有. 厂商有动机美化数字, 这是商业逻辑使然, 没什么好指责的. 但另一方面, 语言能力, 推理能力这些东西本来就很难用单一指标衡量, 不像计算机视觉那样相对清晰.
所以结论是什么呢. 官方benchmark作为参考无可替代, 但判断一个模型适不适合你的场景, 必须自己测. 这两件事不矛盾, 要同时做.
不对吧, 如果每个人都要自己测, 那小团队的成本太高了. 会不会出现一批专门做第三方评测的机构, 像消费者报告那种?
这已经在发生了. 但问题是, 第三方评测机构本身也有被厂商渗透的风险, 或者他们测的场景未必跟你的业务场景匹配. 所以还是回到同一个问题.
我觉得最理想的状态是, 有一套开放的测试框架和标准化的测试集, 大家都往里面贡献, 类似开源社区那种运作方式. Swift Qwen那个社区推动补充benchmark的做法, 其实就是在往这个方向走.
嗯, 有道理. 社区驱动的评测标准, 比单一机构发布的更难被操控. 总结一下今天这个话题的核心就是, 官方跑分看趋势, 自己测验真章, 社区共建才是长期解法.
对, 就是这样. 而且随着模型越来越多, 这件事的重要性只会越来越高. 测评体系会成为基础设施的一部分.
行, 今天就聊到这儿. 联合国数据上云, 微软内部文件曝光, 开源模型社区的活力, 还有benchmark这个越来越重要的话题, 周五信息量不少. 大家中午见.
相关推荐
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。