每日AI新鲜事·08月19日午间版:Cerebras CS4与球面傅里叶变换
每日AI新鲜事·08月19日午间版:Cerebras CS4与球面傅里叶变换
2026年08月19日(周三)午间版 AI新闻速递+热点深度讨论
2026年08月19日(周三)午间版 AI新闻速递+热点深度讨论
今天AI圈的消息不算特别多,但有几条挺有意思的。先来聊聊新闻吧。
李博,Hacker News上刚看到一条,Cerebras发布了CS4,54分27条评论,讨论度还不错。
对,Cerebras这家公司一直在做wafer-scale芯片,就是把整片晶圆做成一个巨大的芯片。CS4应该是他们第四代产品了。
他们之前的卖点一直是推理速度特别快对吧?因为不需要在多个GPU之间做通信。
没错,单片晶圆级芯片最大的优势就是省掉了芯片间互联的开销。对大模型推理来说,这个通信瓶颈其实很严重。
不过他们的挑战一直是良率和散热。整片晶圆只要有一小块区域出问题,整个芯片就废了。CS4能不能在这方面有突破,HN上应该有人在讨论。
确实,27条评论估计里面有不少硬件老哥在分析。感觉今年AI芯片这个赛道越来越热了,不只是英伟达一家独大。
对,而且Cerebras走的路线和其他人都不一样,不是堆GPU集群,而是从芯片架构层面重新想这个问题。
好,下一条。Reddit的深度学习板块有篇帖子,讲的是用球面傅里叶变换做3D旋转等变AI。
这个听起来很学术,但其实挺重要的。简单说就是,当你处理三维空间中的信号时,普通的卷积神经网络对旋转不是天然不变的。
等等,什么叫对旋转不是天然不变的?
比如你把一个分子结构旋转90度,理论上模型应该给出一样的预测结果。但普通CNN做不到这一点,它会把旋转后的输入当成完全不同的东西。
球面谐波函数就是在球面上的一组基函数,类似于平面上的傅里叶基。用它们来表示三维信号,就能天然保证旋转等变性。
所以应用场景主要是分子模拟、蛋白质结构这类?
对,还有点云处理、3D物体识别这些。凡是涉及三维空间对称性的任务,这类方法都有优势。
明白了。接下来还有条轻松点的,有人在Reddit上分享了一个mini search engine项目,索引了170多万篇arXiv论文。
这个挺实用的,按作者名或关键词搜索,不用自己去arXiv上翻。
对,感觉是个学习项目但完成度不错。170万篇的量也不小了。
这种项目对学信息检索的人来说是很好的练手,从爬取到索引到排序,一整套pipeline都得自己实现。
最后还看到Perplexity的CEO Arav Srinivas在Twitter上转了一条说important contribution,不过没太多上下文。
之前他提过compute is the currency那个观点,互动量很高。这次估计也是在推荐什么他觉得重要的工作吧。
好了新闻就先聊到这儿,接下来我们深入聊聊Cerebras CS4这件事吧,因为我觉得AI芯片这个话题值得展开。
行。其实Cerebras的路线从第一代开始就很激进。他们的核心逻辑是:大模型训练和推理的瓶颈不在算力本身,而在数据搬运。
数据搬运?你是说内存带宽还是芯片间通信?
都有。但芯片间通信是更大的瓶颈。你想,一个大模型切成几十块分布在不同GPU上,每一步前向传播都要大量数据在芯片之间传来传去。
Cerebras的做法是把所有计算单元放在一片晶圆上,片内互联的带宽比芯片间高好几个数量级。
但这不是也有明显的问题吗?良率、散热、还有单片晶圆能放多大的模型。
对,这就是为什么他们到了第四代还在迭代。每一代都在解决上一代的工程瓶颈。比如良率问题,他们用了冗余设计,坏掉的核心可以被绕过。
那从市场角度看呢?现在英伟达的生态那么强大,Cerebras能找到自己的位置吗?
我觉得他们的机会在推理侧。训练市场确实被英伟达锁得很死,CUDA生态太强了。但推理这块,延迟和吞吐量是硬指标,谁快谁便宜谁就有市场。
有道理。而且现在越来越多的应用场景是实时推理,延迟敏感。
对,特别是像推理模型这种需要长链思考的,中间要生成很多token,推理速度直接决定用户体验。
所以Cerebras如果能在推理延迟上做到比H100集群快很多,客户是愿意买单的。
没错。而且他们之前的demo已经展示过,在某些模型上推理速度确实碾压GPU方案。问题是规模化部署和成本能不能打下来。
HN上27条评论,估计也是在讨论这些trade-off吧。
大概率是。HN上硬件讨论的质量通常不错,会有业内人出来说实际部署的体验。
说到专用芯片,其实球面傅里叶变换那个研究也让我想到一个问题。是不是未来不同的AI任务会需要不同的硬件架构?
这是个好问题。目前的趋势是GPU作为通用加速器在覆盖大部分任务,但确实有些计算模式用专用硬件效率高得多。
比如球面谐波的计算涉及大量特殊函数和稀疏运算,如果有专用单元来加速这些操作,效率会比在GPU上用通用CUDA kernel高很多。
但问题是市场够不够大,对吧?做一个专用芯片的投入是巨大的。
对,所以像Cerebras这种还是走通用大模型加速的路线,市场足够大。真正的domain-specific加速器目前还是在学术阶段比较多。
明白了。总结一下的话,AI芯片这个赛道现在是通用路线和专用路线并存,但通用那边已经在打差异化了。
没错。Cerebras就是通用路线里的异类,用完全不同的物理形态来解决同一个问题。CS4出来说明他们至少还活着,而且在持续进步。
活着就很不容易了,毕竟做芯片太烧钱。好了,今天就聊到这儿吧。
行,晚上见。
相关推荐
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿Claude Slack智能体升级:多人协作、主动响应与持久记忆全解析
Anthropic为Claude推出Slack集成重大升级,新增多人协作、主动响应和持久记忆三大核心能力,将AI从被动问答工具转变为真正的团队协作伙伴,重新定义企业级AI智能体应用标准。