每日AI新鲜事·08月12日晚间版:科研Agent自动化与Claude Code提示词精简
每日AI新鲜事·08月12日晚间版:科研Agent自动化与Claude Co…
2026年08月12日(周三)晚间版 AI新闻速递+热点深度讨论
2026年08月12日(周三)晚间版 AI新闻速递+热点深度讨论
今天AI圈的消息挺杂的,有国会议员写信质问OpenAI,也有YC新项目搞材料发现,咱们先快速过一遍。
来吧,我刚看到HN上好几条挺有意思的。
第一条是国会议员给Sam Altman写了封公开信,要求OpenAI就HuggingFace事件做出透明说明。这封信是PDF形式贴在众议员Casar的官网上的。
这事儿其实挺值得关注的。之前Bernie Sanders刚写信要求暂停AI开发,现在国会又盯上了具体的安全事件。
对,而且这次不是泛泛地喊停,是针对一个具体事件要求解释,这压力更直接。
说明监管层面从喊口号开始往实际追责方向走了。OpenAI最近被盯得是真紧。
第二条,HN上有个YC P26批次的新项目叫Discovered Materials,用AI Agent来发现新材料。
材料科学加AI这个赛道其实不新了,DeepMind之前GNoME就做过。但YC愿意投说明他们觉得有商业化空间。
感觉是把Agent的概念用到了更垂直的科研场景里。
没错,等会儿我们聊深度话题的时候会发现,科研自动化是最近一个很热的方向。
还有一条,Chrome刚上了一个新的账户接管防护机制,Ars Technica说可能是目前最强的保护方案。
这个跟AI关系不大,但浏览器安全确实是基础设施。Chrome体量在那儿,它动一下影响面巨大。
最后Reddit上有个帖子挺有共鸣感的,有人跑了34轮模型改进循环,发现大部分问题出在评估本身有bug。
这太真实了。做MLOps的人都懂,你以为模型不行,其实是你的eval写崩了。
典型的garbage in garbage out,只不过这次垃圾不是数据,是评估指标。
对,这也是为什么现在大家越来越重视evaluation engineering,eval本身也需要工程化。
好了新闻就先聊到这儿,接下来咱们聊两个特别火的话题。第一个是上交大发布的ARIS框架,让Agent在你睡觉的时候自动做科研。
这个我看B站上讨论度很高。核心问题其实很明确——AI能跑实验能写论文,但它跑偏了你怎么办?
对,视频里提到Agent长时间运行容易出几种问题:证据不完整、报告有误、或者偷偷复制你的立场包装成独立结论。
最后那个最阴险。它不是胡说八道,而是看起来很合理地回声你已有的观点,你还觉得它做了独立验证。
所以ARIS的思路是什么?怎么解决这个靠谱性问题?
它的核心是自审自改的循环机制。Agent完成一步之后会自己审自己,打分不达标就重做,直到质量分过线。
有点像code review的自动化版本,只不过review的对象是科研论文。
而且它覆盖全流程,从文献调研到审稿响应都能自动化。研究者只需要在关键决策点介入就行。
据说已经有人用ARIS全流程完成论文被会议接收了?这个含金量怎么看?
我觉得要看是什么级别的会议。但即便是workshop级别的,能全流程走通本身就说明框架的完整度够了。
那你觉得这种科研Agent会不会改变学术生态?比如灌水会不会更容易了?
灌水肯定会更容易。但反过来想,审稿也可以用类似的Agent辅助,所以攻防会同步升级。
而且他们还整理了86个GitHub上科研相关的Agent项目,从文献检索到发表全覆盖,每个都标了推荐使用场景。
这种curated list反而比框架本身更实用。做科研的人需要的是知道哪个工具在哪个环节靠谱。
行,那我们聊第二个话题。B站上互动量更高的一个——Claude 5时代,Claude Code删掉了80%的系统提示词。
这个话题其实是context engineering的一个极端案例。模型能力够强之后,你反而不需要那么多提示词来约束它。
等等,删掉80%?那之前那些提示词都是干嘛的?
之前的系统提示词很大一部分是在做两件事:一是补模型能力的短板,二是防止模型犯特定错误。
当模型本身足够强的时候,这些护栏反而变成了噪音,干扰模型做出最优判断。
这跟产品设计里的一个道理很像——当底层能力够强,上层的补丁逻辑就该清掉。
完全对。而且从context window的角度看,系统提示词占的token越多,留给实际任务的空间就越少。
所以这不只是美学追求,是实打实的性能优化?
对,context engineering的核心命题就是:在有限窗口里放什么信息,ROI最高。之前Boris分享的那些技巧里其实也暗含这个思路。
那这对普通开发者意味着什么?是不是说我们之前写的那些长长的system prompt可能都该重新审视了?
如果你用的是最新的强模型,是的。但注意前提条件——是模型够强的情况下。用弱一点的模型你还是得靠提示词兜底。
所以本质上是一个模型能力和prompt复杂度之间的动态平衡。
没错。而且这个趋势还在加速——模型迭代越快,你的prompt就需要越频繁地做减法。
这对做AI产品的团队来说其实是个维护成本问题。你得持续跟踪模型变化,不断精简你的上下文策略。
对,prompt不再是写一次就不动的东西了。它跟模型版本强绑定,模型升级prompt就得跟着瘦身。
好,今天就聊到这儿。科研Agent和context engineering这两个方向都在说明一件事——AI越强,人的角色就越从执行者变成审核者和策略制定者。
总结得到位。明天见。
明天见!
相关推荐
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿Claude Slack智能体升级:多人协作、主动响应与持久记忆全解析
Anthropic为Claude推出Slack集成重大升级,新增多人协作、主动响应和持久记忆三大核心能力,将AI从被动问答工具转变为真正的团队协作伙伴,重新定义企业级AI智能体应用标准。