ChatGPT电脑历史功能详解:AI如何记住你的工作流

当AI开始"记住"你的工作方式
OpenAI 为 ChatGPT 和 Codex 桌面应用带来了一项名为 Computer History(电脑历史) 的新功能。它的核心理念很简单却颇具想象力:不再需要每次都向 AI 助手详细描述背景,AI 可以直接"看到"你在电脑上的操作历史,并将其转化为可供随时调用的记忆与时间线。
用官方的话来说,只需在 macOS 桌面应用的设置中打开这一开关,Computer History 就会把你正在进行的桌面操作转化成"记忆",让 AI 智能体在你下一次提问或开始任务时可以直接引用。这标志着 AI 助手从"被动应答工具"向"理解上下文的工作伙伴"迈进了一步。
要理解这一步的意义,需要回顾 AI 记忆系统的演进历程。最早期的对话式 AI 没有任何跨会话记忆,每次对话都是全新的开始。2024年初,ChatGPT 推出了 Memory 功能,允许 AI 在对话中提取用户偏好并存储为文本片段,但这依赖用户主动告知。Computer History 则代表了第三阶段——被动观察式记忆,AI 通过持续感知用户的工作环境来自动积累上下文。
这一演进路径与认知科学中"情景记忆"(episodic memory)的概念相呼应:人类不仅记住抽象知识,还记住具体事件发生的时间、地点和情境,正是这种记忆让我们能够在日常对话中省略大量背景。这一概念最早由加拿大心理学家 Endel Tulving 在1972年提出,他将人类记忆划分为"语义记忆"(关于世界的一般知识)和"情景记忆"(关于个人经历的具体记录)。传统的 AI Memory 功能更接近语义记忆——它存储的是"用户喜欢简洁的代码风格"这类抽象偏好;而 Computer History 则真正模拟了情景记忆——它记录的是"用户今天上午10:23在 VS Code 中重构了认证模块"这样的具体事件。认知科学研究表明,情景记忆之所以对日常交流至关重要,是因为它提供了"共享上下文"——正如你不需要向一位全程参与项目的同事解释项目背景一样,一个拥有情景记忆的 AI 也能省去大量重复沟通。这种从语义记忆到情景记忆的跃迁,可能是 AI 助手真正融入工作流的关键转折点。
ChatGPT电脑历史功能的实际体验
在官方演示中,用户可以直接向 Codex 提出高度依赖上下文的问题,而无需补充任何背景信息。
比如询问"我最近在看的最后一个 Google Doc 是哪个?",Codex 会检索近期活动历史,准确定位到"今天早些时候正在编辑的 video script computer history 文档"。

更进一步,用户可以接着说"帮我确认这个文档分享给了之前群聊里的 Josh 和 Priya"。Codex 不仅知道用户指的是哪个文档,还能理解"之前的群聊"具体指哪一段对话,随后完成分享操作并给予确认。

这种"免上下文对话"是该功能最直观的价值——AI 已经知道你做了什么、看过什么,所以你可以像和一个了解你工作的同事交流那样,省去大量重复的背景说明。
从技术角度看,这里涉及上下文窗口与持久记忆的协同工作:大语言模型的上下文窗口是其在单次推理中能处理的信息量,即使最先进的模型也有上限(如 GPT-4o 约128K tokens,相当于约10万个英文单词或一本中等篇幅的书)。而 Computer History 本质上是一个持久记忆系统,它将用户的操作历史压缩为结构化的摘要和时间线,在需要时检索相关片段注入上下文窗口。
这种"记忆检索增强"的架构,类似于 RAG(Retrieval-Augmented Generation,检索增强生成)技术在个人知识管理场景中的应用。RAG 的核心思想是将大语言模型的生成能力与外部知识库的检索能力相结合:当用户提出问题时,系统首先从知识库中检索最相关的文档片段,然后将这些片段与用户问题一起送入模型生成回答。这一技术最初由 Meta AI 的研究团队在2020年提出,如今已成为企业级 AI 应用的标准架构。在 Computer History 的场景中,"知识库"就是用户的操作历史,系统需要解决的关键问题是:如何从可能长达数天甚至数周的操作记录中,精准检索出与当前问题最相关的片段。这通常涉及将操作事件转化为向量嵌入(vector embeddings)存储在本地向量数据库中,再通过语义相似度匹配来完成检索。与传统基于关键词的搜索不同,向量检索能够理解语义层面的关联——例如当用户问"我上周那个关于定价的讨论"时,系统能够匹配到标题为"Q3 pricing strategy brainstorm"的文档操作记录。
Computer History如何总结你的一天
除了执行具体任务,Computer History 还能对你的工作时间进行回顾。在演示中,当被问及"简要总结一下我今早是怎么度过的"时,Codex 基于本地活动历史生成了一份简洁的复盘:
今早你主要在推进 computer history 发布视频,包括起草、打磨脚本,并与队友迭代表达框架和叙事流程。同时你还在 Codex 里原型化了一个 3D 世界构建器,并处理了一些使用额度相关的反馈。

这种能力对于需要写日报、周报或做时间管理的知识工作者而言极具实用性——AI 能够自动梳理出你的工作重点,而不需要你自己回忆和记录。值得注意的是,这不仅仅是简单的活动日志罗列,而是经过语义理解后的智能归纳:系统能够识别出"在 Google Docs 中编辑文档"和"在 Slack 中与队友讨论文档结构"实际上属于同一个工作主题,并将它们合并为一个连贯的叙事。这种从离散事件到连贯叙事的转换,背后需要模型具备时序推理和主题聚类的能力。
隐私设计:不截屏、不录音,本地可控
面对这样一项深入用户操作的功能,隐私自然是最大的关注点。OpenAI 在设计上做了几个关键权衡:
捕获交互事件而非屏幕画面
Computer History 不依赖屏幕截图或音频录制,而是捕获点击、输入、应用切换等交互事件。这意味着它能够更快速、更高效地形成记忆,同时避免了直接截取屏幕内容可能带来的敏感信息泄露风险。
这一技术选择与此前微软推出的 Windows Recall 功能形成了鲜明对比。Windows Recall 通过每隔几秒截取一次屏幕截图来记录用户活动,这种方式曾引发巨大的隐私争议,因为截图可能包含密码、私人聊天、银行信息等敏感内容,且安全研究人员发现其数据存储存在漏洞。2024年5月微软首次公布 Recall 时,安全研究员 Kevin Beaumont 发现截图数据以明文形式存储在本地 SQLite 数据库中,任何能够访问设备的恶意软件都可以轻松读取全部记录。这一发现迫使微软将该功能从 Windows 11 的初始发布中撤回,经过数月的安全加固后才重新推出,但公众信任已经受损。
而 OpenAI 选择的交互事件捕获,更接近于操作系统层面的无障碍辅助(Accessibility)API 所提供的信息——它记录的是用户"做了什么"(点击了哪个按钮、切换到哪个应用、在哪个输入框输入了文字),而非"看到了什么"。这种方式在信息密度上更高效,因为一次截图中大量像素是冗余的背景信息,而一条交互事件则精准指向用户的意图和行为。举一个具体的例子:一张1920×1080的屏幕截图约占2-5MB存储空间,经过 OCR 识别后可能提取出几百个字符的有效信息;而一条交互事件(如"用户在 Chrome 中点击了书签栏的'项目看板'链接")仅占几十字节,却精确传达了用户行为的核心语义。
Computer History 之所以首先在 macOS 上推出,也与苹果操作系统的权限架构密切相关。macOS 提供了 Accessibility API,允许经过用户授权的应用读取其他应用的界面元素信息(如按钮文本、窗口标题、输入框内容等)。这一 API 原本是为屏幕阅读器等辅助工具设计的,其核心技术是 Apple 的 Accessibility Inspector 框架,它将每个应用的界面抽象为一棵由 AXUIElement 节点组成的层级树——每个按钮、文本框、菜单项都是树中的一个节点,携带着角色(role)、标题(title)、值(value)等属性。VoiceOver 等屏幕阅读器正是通过遍历这棵树来"朗读"界面内容。近年来,越来越多的生产力工具开始利用这一 API 来实现跨应用的智能交互,例如 Raycast、Alfred 等效率工具通过它来识别当前活跃窗口的内容,Bartender 通过它来管理菜单栏图标。macOS 的沙盒机制和显式权限授予流程,为这类深度系统集成提供了相对安全的框架——用户必须在"系统设置 > 隐私与安全性 > 辅助功能"中明确授权特定应用,且可以随时撤销。相比之下,Windows 的 UI Automation API 虽然功能类似,但其权限模型相对宽松,任何应用都可以在不需要额外授权的情况下访问其他应用的界面元素,这也是为什么微软选择了截图方案而非交互事件方案的可能原因之一。
细粒度的访问控制
用户对哪些应用和网站可以被 Computer History 访问拥有精细的控制权。你可以通过新的菜单栏入口快速排除某些网站或整个应用,也可以在桌面应用设置中显式列出需要屏蔽的对象。

记忆数据存储在本地,可查可删
所有被捕获的内容都可以在设置中审查。除了查看摘要,用户还能删除单条记录、清空最近的历史,甚至直接查看实际的记忆文件。这些记忆文件始终保存在用户自己的文件系统上,确保你可以清楚地知道 AI 究竟记住了什么。这种"本地存储 + 完全透明"的设计,是打消用户顾虑的关键。
值得注意的是,"本地存储"并不意味着数据完全不离开设备。当用户向 AI 提问时,相关的记忆片段需要被发送到 OpenAI 的服务器进行推理处理。但关键区别在于:原始的完整操作历史始终保留在本地,发送到云端的只是经过筛选和压缩的相关片段,且仅在用户主动发起交互时才会触发。这种"存储在本地、按需发送"的混合架构,在隐私保护和功能实现之间取得了务实的平衡。
从记忆到自动化:AI工作流的想象空间
Computer History 的野心不止于"记住"。它还能基于你的重复性工作,主动建议技能(skills)和自动化(automations)。这些建议会出现在设置的历史区域中。
一旦 AI 智能体理解了你做什么、怎么做,交互方式便会发生质变。官方列举了几个典型场景:
- 根据你刚完成的操作,让 AI 创建一个可复用的技能;
- 设置每天早上自动运行一个自动化任务,为团队起草站会更新;
- 让 AI 贴合你的工具习惯,比如始终用你惯用的应用来起草文档。
这一方向实质上是将传统的 RPA(Robotic Process Automation,机器人流程自动化)与 AI 的理解能力相结合。传统 RPA 工具(如 UiPath、Automation Anywhere、Blue Prism)需要用户手动录制操作流程或编写脚本来实现自动化,门槛较高且脆弱——界面稍有变化就可能导致自动化失败。RPA 行业在2019-2022年间经历了高速增长(UiPath 曾达到350亿美元估值),但也暴露出严重的"维护地狱"问题:据 Gartner 统计,企业部署的 RPA 机器人中有超过30%在一年内因界面变更而失效,需要持续的人工维护。问题的根源在于传统 RPA 依赖"像素级定位"或"UI 元素选择器"来识别操作目标——例如"点击坐标(523, 187)处的按钮"或"点击 id 为 submit-btn 的元素"——一旦应用更新了界面布局或修改了元素命名,整个自动化流程就会崩溃。
而 AI 驱动的自动化则不同,它基于对操作意图的理解而非对界面元素的精确定位,因此具有更强的鲁棒性和适应性。当 AI 理解了"用户的意图是将这份文档通过邮件发送给项目组成员",即使邮件客户端更新了界面、"发送"按钮从左侧移到了右侧,AI 仍然能够完成任务,因为它追踪的是语义目标而非视觉坐标。
这也是当前 AI Agent(智能体)领域的核心竞争方向。Anthropic 在2024年10月推出的 Computer Use 功能,让 Claude 模型可以直接观看屏幕截图并操控鼠标键盘来完成任务,采用的是"视觉理解 + 直接操控"的端到端方案。Google 的 Project Mariner(2024年12月发布)则专注于浏览器内的自动化,通过 Chrome 扩展让 AI 代理用户执行网页操作。Microsoft 的 Copilot Vision 尝试了类似的屏幕理解方案,而开源社区中 OpenAdapt、AgentQL 等项目也在探索不同的技术路径。
OpenAI 通过 Computer History 选择了一条"先观察理解、再主动行动"的渐进路线。这一策略的巧妙之处在于:它先通过被动观察积累了大量关于用户工作模式的数据和理解,在此基础上提出自动化建议,而不是一上来就要求用户信任 AI 去直接操控电脑。这种渐进式信任建立的策略,在产品落地层面可能比技术激进的方案更容易被用户接受。
这实际上勾勒出了个人 AI 助手的进化方向:从通用的问答工具,逐步演化为深度个性化、能主动分担重复劳动的"数字副驾"。
结语:个性化AI助手的重要一步
Computer History 的推出,反映了 AI 产品竞争的一个新焦点——上下文与个性化。模型能力的提升固然重要,但让 AI 真正"懂你"、无需反复解释背景,往往才是决定日常使用体验的关键。
从更宏观的行业视角来看,这一功能的出现标志着 AI 竞争从"模型性能军备竞赛"向"用户体验与生态粘性"的转移。当 GPT-4o、Claude 3.5、Gemini 等顶级模型在基准测试上的差距日益缩小时,谁能更深入地嵌入用户的工作流、积累更多的个性化上下文,谁就能建立起更高的迁移成本和用户忠诚度。这也解释了为什么 OpenAI 在模型层之外持续投入桌面应用、记忆系统和工具集成——这些看似"非核心"的功能,实际上正在构建一条难以复制的护城河。
通过"捕获交互事件而非画面"的技术路径,以及"本地存储、可查可删"的隐私设计,OpenAI 试图在便利与安全之间找到平衡点。当然,这类深度感知用户行为的功能是否会被广泛接受,最终仍取决于用户对隐私控制的信任程度。目前该功能已在 macOS 桌面应用中开放,值得关注个性化 AI 趋势的用户亲自体验一番。
核心要点
核心要点
相关推荐

Claude自主设计蛋白质成功率35%,远超人类专家水平
Anthropic的Claude模型在自主设计靶向疾病蛋白质任务中取得35%实验成功率,远超人类专家10%-15%的平均水平。本文深入解析这一湿实验验证成果对生物医药行业的潜在影响。

Perplexity Discover多语言支持突然消失,国际用户为何不满?
Perplexity Discover新闻资讯功能突然取消多语言支持,仅保留英文内容,引发国际用户强烈不满。本文分析功能回退的可能原因,探讨AI产品国际化面临的资源权衡与用户信任挑战。
