FMOS:给基础模型装上自进化的操作系统层

论文主张构建「基础模型操作系统」FMOS,像虚拟机抽象硬件那样统一虚拟化AI模型交互,解决智能体生态碎片化困局。
随着AI应用从单一基础模型演进为多模型协同的复合智能体系统,底层基础设施的碎片化问题日益严峻:各框架各自内嵌运行时、独立管理状态与安全护栏,导致系统行为无法跨平台移植,治理机制脆弱。arXiv 上这篇立场论文将这一现状类比为操作系统诞生之前的计算机时代,并提出构建「基础模型操作系统」(FMOS)作为解法。FMOS 定位为系统抽象层,虚拟化模型交互,对上层应用屏蔽模型选择、记忆管理、预算控制等底层复杂性。其内部承担跨记忆层知识编排、模型调度与资源分配、统一策略执行三大职责。更具前瞻性的是,FMOS 借鉴人脑快慢双系统理论,具备自适应介入与持续自我进化能力,是方向性框架而非工程实现。
从单一模型到复合智能体:碎片化的技术栈
AI 应用的形态正在发生根本转变。过去,一个应用往往依赖单一、庞大的基础模型(Foundation Model, FM)完成所有任务;如今,越来越多的系统演变为由多个模型、工具和智能体协同工作的复合式智能体系统(compound agentic systems)。这种架构演进带来了能力上的飞跃,却也暴露出底层基础设施的严重滞后。
arXiv 上一篇立场论文《Position: It is Time to Virtualize Foundation Models with a Self-evolving Operating System Layer》直指当前问题的核心:尽管 MCP、A2A 等协议已经在简化工具与智能体之间的连接,但每个框架内部仍然各自实现了一套隐式的运行时(runtime),分别管理状态、记忆、预算和安全护栏。这导致系统行为无法跨平台移植,治理机制也变得脆弱不堪。

作者用一个精妙的类比描述了这种状态:它像极了操作系统诞生之前的计算机时代——那时每个程序都要自己重新实现一遍基础服务,从内存管理到设备驱动无一例外。缺乏统一的系统抽象层,让重复劳动和不兼容成为常态。
MCP(Model Context Protocol)是 Anthropic 于2024年提出的开放标准,旨在统一AI模型与外部工具、数据源之间的通信接口,类似于编程领域的 USB 标准。A2A(Agent-to-Agent)协议则专注于智能体之间的直接通信与协作,允许不同框架开发的智能体互相委托任务。两者的出现确实简化了"连接"层面的问题,但正如论文指出的,连接之后的运行时管理——上下文窗口如何分配、记忆如何持久化、预算超支如何熔断、输出如何过滤——每个框架(如 LangChain、AutoGen、CrewAI)仍各自内嵌了一套私有实现,这正是碎片化的深层根源。
FMOS:为基础模型交互做虚拟化
论文提出的核心主张是:这个领域现在需要一个「基础模型操作系统」(Foundation Model Operating System, FMOS)。它的定位是一个系统层,作用是对基础模型的交互进行虚拟化——正如虚拟机(VM)将物理硬件抽象化一样。
这个类比值得展开。虚拟机的价值在于,它让每个应用都产生一种「独占一整台机器」的错觉,屏蔽了底层硬件的复杂性和共享带来的冲突。FMOS 想要提供的,则是让应用产生「独占一个可信、能力近乎无限的模型实例」的错觉。应用开发者不再需要关心背后到底调用了哪个模型、如何管理上下文、预算是否超支,这些都交由系统层统一处理。
这一抽象的意义在于解耦。当模型交互被虚拟化之后,应用逻辑与具体的模型实现、运行时策略分离开来,行为的可移植性和治理的稳定性都能得到根本改善。
系统层内部:编排、选择与验证
那么 FMOS 内部究竟做什么?论文给出了三个层面的职责:
跨记忆层的知识编排
FMOS 需要在不同的记忆层级(memory tiers)之间编排知识流动。这与传统操作系统在寄存器、缓存、内存、磁盘之间管理数据的思路一脉相承——不同层级在速度、容量和成本上各有取舍,系统需要智能地决定什么知识放在哪一层。
模型选择与资源分配
在复合系统中,任务往往可以由不同能力、不同成本的模型来完成。FMOS 承担起模型选择(model selection)和资源分配(resource allocation)的调度职责,在效果与开销之间做出权衡,而不再让每个框架各自为政。
验证与策略执行
安全护栏和治理规则不应散落在各个框架内部。FMOS 将验证(verification)与策略执行(policy enforcement)统一到系统层,使得治理变得集中、可控、可审计,从根本上解决前文所述的「治理脆弱」问题。
会自我进化的操作系统
论文最具想象力的部分,是 FMOS 的「自进化」特性。作者借用了人类大脑的双系统理论作类比:大脑会在快速直觉(fast intuition)与慢速审慎思考(slow deliberation)之间切换。FMOS 也应当学会判断——什么时候需要介入干预,什么时候可以让推理直接进行。
更关键的是,这套策略并非固定写死,而是能够基于运行中的实际经验持续自我调整(continuously adapting its policies based on operational experience)。这意味着 FMOS 不只是一个静态的调度框架,而是一个随着使用不断优化决策的动态系统。这种设计理念,把操作系统从「规则执行者」提升到了「经验学习者」的高度。
「快慢双系统」理论源自心理学家丹尼尔·卡尼曼在《思考,快与慢》中的框架:系统1负责快速、自动、直觉性的反应,系统2负责缓慢、费力、逻辑性的推理。将这一框架迁移到 FMOS 的语境下,意味着系统层需要元认知能力——能判断当前请求的复杂度与风险级别,低风险的常规调用直接透传(类似系统1),高风险或资源密集型任务则触发更复杂的调度与验证流程(类似系统2)。这种自适应的介入机制,是 FMOS 区别于传统静态调度框架的核心设计理念,也是「自进化」能力的基础:系统通过观察哪些决策产生了良好结果,持续校准介入阈值。
一个方向性判断
需要明确的是,这是一篇立场论文(position paper),它的价值在于提出方向和框架,而非给出完整的工程实现。作者的核心论断——AI 基础设施正处在「操作系统诞生前夜」——具有相当的解释力,它把当前智能体生态的乱象归因于缺失统一系统抽象层这一根本问题。
如果 FMOS 的构想能够落地,它可能重塑智能体开发的整个技术栈:开发者面向一个稳定的系统接口编程,而模型选择、记忆管理、安全治理等底层复杂性都被系统层吸收。这与几十年前操作系统解放应用开发者的历史进程高度相似。当然,从概念到可用系统之间仍有漫长的路要走,双系统式的自适应策略如何实现、如何保证可信性,都是留待后续研究解答的开放问题。
相关推荐

AAAI-27第一阶段评审结果临近:投稿者需关注什么
AAAI-27第一阶段(Phase 1)评审结果预计9月24日公布,本文解读AAAI分阶段评审机制、投稿者应对策略以及学术社区在结果等待期的协作价值。

FAISS向量搜索实战入门:从Embedding到RAG的踩坑心得
一位开发者分享FAISS向量搜索的实战入门心得,讲解从Embedding到RAG的完整数据流,并深入探讨人名、日期、过滤条件和对话历史等真实场景下的检索难点与应对方案。

H3 Camera Control v3来袭:视频镜头控制与快速渲染上线
H3 Camera Control v3更新预告发布,将带来视频镜头控制与快速渲染两项核心升级,提升AI视频创作的可控性与效率。本文解读新功能方向与行业意义。