[控场AI]
· 4 分钟阅读· 2,391 字

Notion抢先体验GPT-6 Astra:从AI助手到"资深工程师协作者"

Notion抢先体验GPT-6 Astra:从AI助手到"资深工程师协作者"

Notion工程师分享GPT-6 Astra实战体验:协作模式从"分配任务"升级为"托付目标"。

本文记录了Notion工程师Gwyn在与OpenAI合作对谈中分享的GPT-6 Astra使用体验。核心观点是:新一代模型的定位已从执行琐碎工单的工具,转变为可以接受高层目标的"资深工程师协作者"。相比上一代Sol模型,Astra最显著的进步在于沟通质量——能清晰表达自己的发现与困惑,大幅缩短人机闭环所需时间。在缓存复用成本优化的实战任务中,Astra不仅识别出人类团队审计时遗漏的整体模式,还能推断背后潜藏的深层问题。Notion因此建议团队用"仪表盘数字再加一个9"这类顶层目标而非具体任务来驱动模型。文章最后也提示,相关描述来自官方合作对谈,带有一定推广性质,需等待更广泛的独立验证。

从"给工单"到"给难题":AI角色的根本转变

在Notion与OpenAI合作的这场对谈中,一个核心比喻贯穿始终:新一代模型GPT-6 Astra更像是一位"资深工程师协作者"(staff engineer collaborator),而不是过去那种执行琐碎任务的工具。

对谈中一句话点出了本质:"你不会给一位资深工程师塞一堆小工单,你会把一个你之前尝试过却没能解决的难题交给他。"这句话精准描述了人与AI协作模式的迁移——从任务分解式的"喂饭",转向目标导向式的"托付"。

这不仅是模型能力的提升,更是工作方式的重构。去年的编码方式还是"给它任务、帮它扫清障碍",而今年则变成了"给它一个目标,帮它导航"。工程师投入到主动协作中的时间明显缩短。

Astra在Codex中的真实体验:会"说人话"的模型

Notion的工程师Gwyn主要在Codex环境中使用Astra,因为那是他作为工程师日常工作的主战场。他给出的第一印象很有代表性。

我主要在Codex里使用它,因为作为工程师那是我大部分时间待的地方

他指出,此前使用Sol(上一代模型)等模型的体验是:模型很聪明,能发现很有意思的东西,但"非常不擅长告诉我它发现了什么"。而Astra在沟通上要好得多——它更像是"人对人"的交流方式。

对于以"给模型解除阻塞"为主要工作的工程师来说,沟通质量直接决定了协作效率。Gwyn描述道,他现在盯着聊天窗口的主要目的,是搞清楚"模型在问我什么问题、我需要回答什么"。

搞清楚它在问我什么、我需要回答什么

这意味着与模型"闭环"的速度更快了,主动投入协作的时间也随之缩短。当模型能清晰表达自己的困惑和需求时,人类的介入就变得高效而精准。

Codex在此处指OpenAI面向软件工程场景推出的代理式编码环境,允许模型在沙箱中自主执行多步骤操作,包括读写代码文件、运行测试、调用工具等,而不只是在对话框中生成代码片段。与普通聊天式补全不同,Codex场景下工程师扮演的角色更接近"监督者"而非"操作者"——模型自主推进任务,人类的主要介入点在于解除模型遭遇的阻塞(unblocking)。这也正是沟通清晰度如此关键的原因:模型若无法准确描述自己卡在哪里、需要什么信息,工程师就必须耗费大量时间猜测和反复确认,协作效率大打折扣。

第一个实战任务:找出缓存优化中被遗漏的模式

Notion在token上花费巨大,而影响成本的关键因素之一是缓存复用(cache reuse)的效果——实际表现距离理论最大值还有多远。这正是Gwyn交给Astra的第一个真实任务。

他的指令很直接:"这是我们之前做过的所有工作,这是我们目前的理解,我们上次审计时漏掉了什么?"

Astra找到了那些被遗漏的东西,而Sol只能深挖某个点看到局部模式

结果颇具说服力。Sol能够深入某个具体问题、看到局部的模式,而Astra则能"更快地把点连成线",识别出那些被人类团队忽略的整体模式——并进一步推断出"如果你仔细想想,这其实暗示着别的事情正在发生"。

更重要的是表达方式。Astra的输出"非常清晰:这是问题所在,这是具体场景,干净利落,没有废话"。Gwyn评价说,这几乎就是他自己会采用的写法,"我不需要反复重读就能理解"——这与他过去让编码代理解释发现时的糟糕体验形成鲜明对比。

**缓存复用(Cache Reuse)**是大语言模型API调用中的一项重要成本优化机制。当请求的前缀部分(如系统提示、长文档上下文)与之前的请求完全一致时,模型服务商可以复用已计算好的KV缓存(Key-Value Cache),从而跳过对这部分token的重复计算,显著降低推理延迟和计费成本。对于Notion这类高频调用API的企业用户,系统提示和背景文档往往占据每次请求的大半token,缓存命中率(hit rate)的细微差异可以直接转化为可观的成本差距。"理论最大值"与实际表现之间的差距,通常源于请求顺序安排不当、提示词微小变动导致前缀失配、或多租户并发场景下的缓存失效等隐蔽问题——这类系统性模式正是难以靠人工逐一排查的痛点所在。

给团队的使用建议:设定目标而非任务

很棒

随着Astra在Notion内部铺开,Gwyn给同事们的建议延续了"资深工程师"的思路:不要给它一个具体任务,而是给它一条顶层目标。

他打了个生动的比方:"给它仪表盘上的一个数字,告诉它'这个数字需要再加一个9'(意指从99%提升到99.9%这类可靠性/效率目标),这才是你应该交给这个模型的合适范围。"

这一建议背后,是对AI协作范式的清晰认知:当模型具备了连接线索、清晰沟通和自主导航的能力后,人类应当把它当作可以托付高层目标的协作者,而不是需要事无巨细指挥的执行工具。

值得关注的信号

这场对谈虽然简短,却透露出几个方向性信号。其一,模型评价标准正在从"能否找到答案"转向"能否清晰沟通并推动闭环"——沟通质量成为衡量AI能力的重要维度。其二,企业级AI应用的价值不只在生成代码,更在于发现人类团队忽略的模式与成本优化机会。其三,人机协作的粒度正在从"任务级"上升到"目标级"。

需要说明的是,本文内容来自Notion与OpenAI的官方合作对谈,属于单一来源的抢先体验分享,其中对Astra能力的描述带有一定的推广性质,实际表现仍有待更广泛的独立验证。

分享:

相关推荐