每日AI新鲜事·08月27日午间版:Gemini 3.5 Transcribe与Accept Markdown
每日AI新鲜事·08月27日午间版:Gemini 3.5 Transcrib…
2026年08月27日(周四)午间版 AI新闻速递+热点深度讨论
2026年08月27日(周四)午间版 AI新闻速递+热点深度讨论
今天AI圈又有不少新消息,而且有个挺有意思的技术话题,我觉得值得聊深一点。先过几条新闻吧。
第一条,Hacker News上看到OpenAI搞了个WebMCP Challenge。
对,这个挺有意思的。MCP协议现在越来越火,OpenAI直接搞了个挑战赛,鼓励开发者用Web端的MCP做应用。
感觉各家都在抢MCP生态的话语权,OpenAI这是想把标准往自己那边拉一拉?
多少有这个意思。MCP本来是Anthropic提出来的嘛,OpenAI现在下场办比赛,说明他们也认可这个方向,但肯定想在实现层面加点自己的东西。
好,第二条也是HN上的,有人做了世界上最小的双频段飞机追踪器,ADS-B接收模块。
这个是硬件项目,双频段意味着同时收1090和978兆赫兹。做到最小尺寸挺厉害的,航空爱好者应该很兴奋。
确实是个很geek的东西。第三条,YouTube上有个视频标题很直白,就叫Holy shit this model is good。
这标题党程度满分。不过现在新模型确实层出不穷,可能是在说最近发布的某个模型表现超预期。
然后第四条我觉得挺值得关注的。HN上八十多分的帖子,讲的是用HTTP的Accept Header给AI Agent提供Markdown格式的内容。
这个我觉得是个特别好的思路。现在AI Agent爬网页获取信息,拿到的都是HTML,各种标签噪音很大。如果服务器能根据Accept头直接返回Markdown,Agent处理起来就干净太多了。
四十多条评论说明社区确实在讨论,这个等会儿深入聊。最后一条,比尔·盖茨2023年那篇AI风险的文章又被翻出来了。
三十多分二十九条评论,说明大家还是在回顾当初的判断对不对。之前盖茨刚在HN发了新文章嘛,估计有人翻旧账对比。
对,他前两天那篇The turbulent AI era is here,现在社区就把他三年前的观点拿出来看,有没有打脸。
总体来说他2023年就说风险真实但可控,现在2026年回头看,至少方向没错,只是具体细节肯定有出入。
好了新闻就先聊到这儿,接下来我们聊聊最近一个特别火的话题。
李博,Google刚出了Gemini 3.5 Transcribe模型,Reddit和Twitter上都在讨论。而且Logan在Twitter上发了条互动量特别高的推,说自己对Gemini坚定看好。
对,Logan那条推互动量四千多,他是Google那边的人嘛,说I remain steadfast bullish on Gemini。这个时间点发,明显是配合Transcribe模型的发布。
Transcribe这个模型定位是什么?专门做语音转文字?
对,但它不是普通的ASR。叫Gemini 3.5 Transcribe,说明它是建立在Gemini 3.5基础上的专用模型,应该具备很强的上下文理解能力。
传统ASR就是声学信号到文字,但如果底座是大语言模型,它能做很多传统转写做不了的事。比如自动加标点、区分说话人、理解专业术语的上下文。
Reddit上大家反应怎么样?
r/Bard那边有讨论帖,大家主要关注两点:一是跟Whisper比怎么样,二是定价会不会比现有方案便宜。
说到这个,现在语音转写这块竞争其实已经挺激烈了吧。OpenAI有Whisper,各家云服务商都有自己的方案。
是,但Google的优势在于它能跟整个Gemini生态打通。你想,转写完直接用Gemini做摘要、提取行动项、生成会议纪要,这一条龙下来,体验会很丝滑。
所以这不只是一个转写工具,而是Gemini生态里的一个环节。
没错,而且我觉得Google这个时候出这个模型是有战略意图的。你看现在AI Agent越来越多,Agent需要处理的信息不只是文字,音频、视频都是输入源。
有了专门的Transcribe模型,Agent就能更好地处理会议录音、电话通话这类音频数据。
说到Agent处理信息,这就跟刚才提到的Accept Markdown那个话题连上了。
对,小雨你这个串联很好。本质上都是在解决同一个问题——怎么让AI Agent更高效地获取和处理信息。
Accept Markdown这个方案具体怎么工作的?我理解就是Agent请求网页时,在HTTP头里声明我想要Markdown格式?
对,就这么简单。Agent发请求时加个Accept: text/markdown,如果服务器支持,就直接返回Markdown而不是HTML。服务器不支持的话,还是返回HTML,向后兼容。
HN上四十多条评论在争论什么?
主要有两派。一派觉得这思路好,简洁优雅,利用现有的HTTP协议机制就行了。另一派觉得这解决不了根本问题,因为大部分网站不会主动支持这个。
确实,这需要网站主动适配。那网站有什么动力去做这个事?
动力其实有。你想,现在很多网站都在被AI爬,如果你能主动提供一个干净的Markdown版本,其实是在控制AI看到什么内容。比robots.txt更精细的控制。
哦这个角度有意思,相当于与其被动被爬,不如主动提供一个你希望AI看到的版本。
对,而且从SEO角度想,未来AI搜索越来越重要,如果你的内容对AI更友好,被引用的概率就更高。这可能成为一种新的AI SEO。
这两个话题放在一起看,感觉现在整个基础设施层都在为AI Agent时代做准备。
没错。Transcribe解决的是非文本到文本的转换,Accept Markdown解决的是让文本更适合AI消费。都是在铺路。
所以Logan说对Gemini坚定看好,可能不只是说某个单一模型强,而是整个生态在补全。
我觉得是。Google的优势一直是全栈能力——搜索、云、端侧设备都有。现在加上专用的转写模型,它的AI生态确实越来越完整了。
不过话说回来,光有好模型不够,产品体验才是关键。这方面Google的历史嘛,懂的都懂。
得了吧,你这是在说Google的产品经理不行?
我没说啊,我就是说它做产品时经常有始无终。不过最近Gemini确实在进步,算是打了个翻身仗。
行吧,总结一下今天的感受。AI基础设施在各个环节都在快速演进,从模型能力到数据获取到Agent协议,每一层都有人在做事。
对,而且这些事情看着小,但积累起来会产生质变。等这些基础设施都就绪了,Agent的能力会有一个跳跃。
好,今天就聊到这儿。各位听众晚上见。
晚上见。
相关推荐
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。