GPT-6 Astra实测:一句话完成功能开发与测试

GPT-6 Astra在Ramp内部测试中展现出接收模糊指令、自主操作界面并多端验证的AI Agent能力。
金融科技公司Ramp的AI团队在实际工作流中测试了OpenAI的GPT-6 Astra,发现其最大亮点是能接收高层模糊目标而非逐行指令,并像可信赖的同事一样自主推进任务。技术层面,Astra的编码框架可触发Computer Use能力,在一个路由策略功能开发案例中,模型自行推断界面操作路径,12分钟完成开发、15分钟完成自我验证,甚至主动补充了用户未要求的移动端验证。Ramp计划将这项能力落地到客户侧,用于后台自动抓取各商户平台收据,以期减少繁琐的人工引导,实现AI自动化服务的规模化交付。这一案例折射出AI Agent从"写代码工具"向"自主操作+验证闭环"演进的行业趋势。
OpenAI的下一代模型GPT-6 Astra正在被金融科技公司Ramp的AI团队推向极限。在一段与Ramp AI负责人的对话中,我们看到了Astra在实际工作流中的表现——它更像一个懂你意图、能自主推进任务的同事,而非需要逐行指令的工具。
像可信赖的同事,而非需要百行指令的工具
Ramp AI负责人对Astra的第一印象很直接:这是一个你可以信任的同事。你不需要给它一百行指令,只需要给出一个高层目标和想看到的结果,然后10到15分钟后回来验收即可。
"Astra非常擅长接收这种模糊的请求,并准确知道我想要什么输出,还会把改动的截图返回给我,"他表示。这种能力让他觉得可以把越来越多含糊的任务交给Astra处理。

真正的"哇"时刻,来自于Astra在无需人工介入的情况下推进任务的速度。它的表达也很简洁——没有冗余的客套话,在需要来回沟通、直奔结果的工作场景中,这一点尤为可贵。
Computer Use:编码框架可以触发计算机操作
对话中最引人关注的技术细节,是Astra的编码框架(coding harness)能够触发计算机操作(computer use)。这意味着模型不仅能写代码,还能像人一样操作界面去验证结果。

Ramp负责人展示了一个具体案例:他提出一个功能需求——"按API密钥粒度实现路由策略控制"(implement routing strategies controls by API key granularity),除此之外没有任何补充说明。
令人惊讶的是,Astra自己弄清楚了操作路径——需要点击某个现有的API密钥,再点击路由策略选项才能弹出对应界面。他不需要解释"点这个标签、在这个页面、这个路由、这个弹窗",Astra"就是知道"。
Computer Use(计算机操作)是指AI模型直接控制鼠标、键盘和屏幕的能力,能够像人类用户一样浏览网页、点击按钮、填写表单。Anthropic于2024年底率先在Claude模型中公开演示这一能力,OpenAI随后也在其模型路线图中跟进。这项技术的核心突破在于:模型不再仅仅生成文本或代码,而是可以通过截图感知当前界面状态,并据此规划下一步操作。这与传统RPA(机器人流程自动化)工具有本质区别——RPA依赖预先录制的固定脚本,遇到界面变化便会失效;而基于大语言模型的Computer Use能理解界面语义,具备一定的容错和自适应能力。Astra的"编码框架触发计算机操作"意味着模型可以在代码生成与界面交互之间无缝切换,先写代码、再操作浏览器验证效果,形成一个闭合的开发验证循环。
12分钟开发,15分钟自我验证
在这个功能实现案例中,Astra工作了约12分钟完成开发,随后又花了约15分钟验证自己的改动。它精确定位到了需要修改的模型和设置项。

更出乎意料的是,Astra甚至在移动端验证了改动——而这一步用户根本没有要求。Ramp负责人认为,计算机操作能力将越来越成为人们验证低风险改动的重要方式:模型不仅完成任务,还主动确保结果在多种场景下都成立。
下一步:把Computer Use交到客户手中
展望未来,Ramp最兴奋的方向是把计算机操作能力交到客户手中。Ramp的核心价值之一在于自动化简化会计流程,而computer use正是实现这一点的关键。

目前,Ramp在后台为客户抓取收据(fetch receipts)时使用计算机操作技术,但需要大量手动提示(manual prompting),以确保模型知道在各个商户网站上该去哪里操作。
Ramp负责人期待用Astra测试更长尾的商户网站,看它如何应对。他相信Astra对大多数网站的运作方式有更好的理解,能够减少这种繁琐的人工引导——这将是把AI能力真正规模化交付给终端用户的重要一步。
Ramp此处提到的"后台抓取收据"(receipt fetching)是一个典型的长尾自动化场景:企业员工在亚马逊、Airbnb、Uber等数百个不同商户网站消费后,需要登录各平台下载电子发票,用于财务报销和税务合规。由于不同商户的账单页面结构差异极大,传统自动化脚本必须为每个网站单独编写规则,维护成本极高。目前Ramp的做法是依赖大量"手动提示"来告诉模型每个网站的操作路径,本质上仍是人工知识的固化。Astra若能凭借对网站通用结构的理解自行探索导航路径,将极大降低接入新商户所需的人工成本,使这类能力真正具备规模化落地的可行性。
从对话看AI Agent的演进方向
这段来自YouTube的Ramp × GPT-6 Astra对话,虽然是厂商视角的展示,但揭示了当前AI Agent发展的几个趋势:从"精确指令"转向"意图理解",从"写代码"扩展到"操作界面并自我验证",以及从内部工具走向面向客户的自动化服务。
当模型能够接收模糊目标、自主规划操作路径、并在多端验证结果时,人机协作的边界正在被重新定义。对于Ramp这样依赖大量重复性网页操作的业务而言,这类能力的成熟意味着可以把更多长尾、繁琐的任务交给AI去处理。
文中描述的"从精确指令转向意图理解"对应AI领域的一个核心研究方向:任务规范的抽象层次提升。早期的AI助手需要用户以结构化、无歧义的方式描述每一步操作;当前一代Agent模型则试图在接收自然语言高层目标后,自主分解子任务、推断缺失信息并制定执行计划。这一能力的技术支撑来自多个方面:更强的上下文理解与长程推理能力、工具调用(function calling/tool use)与多模态感知的结合,以及通过强化学习优化的任务规划策略。Astra在未被要求的情况下主动进行移动端验证,体现的正是这种"目标导向而非指令导向"的自主性——模型内化了"功能验证应覆盖多平台"这一隐性工程规范,而非仅执行字面要求。
相关推荐

GPT-6 Sol与Luna实测:建模、游戏、写作全面对比
B站UP主实测GPT-6 Sol与Luna Max在3D建模、小游戏、写作三大场景的表现,并与Opus 5.5横向对比。Sol降价带来Codex额度利好,但创意生成能力仍不及Opus 5.5,Luna小模型也有清明上河图贴图惊喜。

GPT-6 Soar对比GPT-5.6 Soar实测:更快更省的真实差距
GPT-6 Soar与GPT-5.6 Soar实测对比:从SVG绘图、代码理解到3D场景生成,记录耗时、额度消耗与完成质量。简单任务难分高下,复杂任务中GPT-6 Soar在速度、成本和方位准确性上明显占优。

GPT-6 Luna实测:性价比最高的干活模型
GPT-6 Luna实测评测:价格比GPT-5.6 Luna再降50%以上,5亿Token只扣3%额度。本文分享Luna的实际干活能力、Skill调用短板、执行者定位以及上下文窗口配置技巧,帮你找到性价比最高的AI模型使用方式。