Inkling模型深度解析:西方首个前沿开源多模态大模型

Inkling发布:填补西方前沿开源多模态模型的空白
Thinking Machines 近日发布了他们的首个开源权重模型 Inkling,这在开源大模型领域是一件颇具分量的事件。为什么说它重要?因为它以 Apache 2.0 协议开源,从零开始训练(除了依赖 NVIDIA 硬件外,不复用任何现有架构),并且从设计之初就是原生多模态的模型。
Apache 2.0 是目前最为宽松的开源许可协议之一,它允许用户自由使用、修改、分发软件,甚至可以用于商业用途,且无需公开修改后的源代码。相比之下,许多所谓的"开源"模型实际上采用的是限制性许可(如 Meta 的 Llama 系列使用的社区许可证,对月活超过 7 亿的产品有额外限制)。Apache 2.0 协议意味着任何企业、研究机构或个人开发者都可以无条件地将 Inkling 用于商业产品,这对于推动模型在产业界的广泛落地具有根本性意义。
长期以来,大模型的发布格局可以清晰地划分为两个阵营:西方实验室主要发布前沿级别的闭源模型,而开源模型则主要依赖中国公司推动——但后者大多是文本优先(text-first)的模型。真正来自西方实验室的前沿级开源权重模型,此前几乎是一片空白。Inkling 的出现,正在改变这一格局。
更难得的是,它的多模态能力是从底层构建的——训练数据同时包含文本、图像和音频输入,而不是后期拼接的模块。当前大多数多模态模型采用的是"拼接式"架构:先训练一个强大的文本大模型,然后通过视觉编码器(如 CLIP 或 SigLIP)将图像特征映射到文本模型的嵌入空间,再用一个投影层或适配器进行对齐。这种方法虽然工程上高效,但模型对视觉信息的理解本质上是通过"翻译为文本"来实现的,跨模态的深层语义融合有限。而原生多模态意味着模型从预训练阶段就同时接收文本、图像和音频数据,各模态在 Transformer 的注意力层中直接交互,使模型能够建立更深层次的跨模态关联。Google 的 Gemini 系列也采用了类似的原生多模态训练策略。
Inkling架构解析:接近万亿参数的稀疏MoE模型
从技术规格来看,Inkling 是一个相当庞大的模型:
- 参数规模:接近一万亿(trillion)参数
- 上下文窗口:100 万 tokens(Playground 实际限制为 256K)
- 训练数据:45 万亿 tokens 的多模态混合数据
- 架构类型:混合专家(MoE),共 256 个专家 + 2 个共享专家
- 激活参数:每个 token 路由到 6 个专家,激活约 410 亿参数
这意味着 Inkling 是一个相对稀疏的模型——虽然总参数接近万亿,但每次推理只激活约 41B 参数,从而在保持模型容量的同时控制推理成本。
混合专家架构(MoE)是一种条件计算技术,其核心思想是:模型拥有大量的专家子网络(在 Inkling 中为 256 个路由专家 + 2 个共享专家),但每次推理时只激活其中一小部分。具体来说,每层都有一个门控网络(gating network / router)负责决定将当前 token 路由到哪些专家处理。Inkling 每个 token 路由到 6 个专家,意味着路由稀疏度约为 6/256 ≈ 2.3%。共享专家则是所有 token 都会经过的专家,负责处理通用特征。这种设计最早由 Google 在 Switch Transformer 中大规模验证,后被 Mixtral、DeepSeek-V3 等模型广泛采用。MoE 的核心优势在于:模型的知识容量由总参数量决定(接近万亿),但计算成本由激活参数量决定(仅 41B),从而实现了容量与效率的平衡。不过 MoE 也面临负载均衡(部分专家被过度使用而其他专家闲置)和通信开销(多机部署时专家分布在不同 GPU 上)等工程挑战。
Inkling 采用的是 decoder-only 结构。Decoder-only 是指模型仅使用 Transformer 的解码器部分,采用因果注意力掩码(causal attention mask),使每个 token 只能关注它之前的 token。自 GPT 系列证明了 decoder-only 在生成任务上的强大能力后,几乎所有主流大语言模型(包括 GPT-4、Claude、Llama、Qwen 等)都采用了这一架构,其优势在于训练和推理流程统一、自回归生成自然流畅,且通过 KV 缓存机制可以高效地进行增量解码。
说个细节,Inkling 是一个推理模型(reasoning model),因此"思考力度"(thinking effort)对性能起着关键作用。推理模型是 2024 年以来大模型领域的重要趋势,以 OpenAI 的 o1/o3 系列和 DeepSeek-R1 为代表。与传统的"直觉式"响应不同,推理模型会在生成最终答案前进行一段显式的思考过程(chain-of-thought),这段思考通常以特殊标记包裹,用户可以选择查看或隐藏。思考力度调节允许用户在速度与质量之间做权衡:低思考力度下模型快速给出直觉答案,适合简单任务;高思考力度下模型会进行更长的推理链条,适合数学、编程等需要深度思考的复杂任务。这种机制本质上是通过控制推理时计算量(inference-time compute)来调节模型表现,是对传统"一次前向传播出结果"范式的重大突破。

基准测试表现:多模态能力领先开源模型
从各项 benchmark 来看,Inkling 在大多数指标上并非当前最强(SOTA),但它是一个非常全面、均衡的模型。考虑到这是 Thinking Machines 的首个开源权重模型,这样的成绩已经值得肯定。
它真正的亮点在于多模态能力——在多个关键多模态基准上,Inkling 击败了大多数其他开源权重模型。据推测,正是这个模型驱动了 Thinking Machines 此前展示的"交互模型(interaction models)"。
此外,在设计能力上它的表现相当突出。根据 Design Arena 排行榜,Inkling 仅次于前沿闭源模型和 GLM 5.2——作为首个开源发布,这是一个不小的成就。
Tinker平台与产品生态:微调Inkling的完整方案
Inkling 是 Thinking Machines 的第三个产品发布:
- Tinker:一个用于后训练(post-training)模型的 API 产品
- 交互模型:近期展示但尚未公开
- Inkling:本次发布的开源权重模型
后训练是指在基座模型预训练完成后进行的一系列训练步骤,通常包括监督微调(SFT)、基于人类反馈的强化学习(RLHF)或直接偏好优化(DPO)等。Tinker 作为后训练 API 产品,代表了一个正在兴起的商业模式:提供免费或低成本的开源基座模型,然后通过后训练服务盈利。这种模式降低了企业使用大模型的门槛——用户无需自行搭建训练基础设施,只需准备领域数据并通过 API 提交训练任务。类似的产品还有 OpenAI 的 fine-tuning API 和 Together AI 的训练平台。对于拥有独特多模态数据(如医疗影像、工业质检图像等)的企业来说,这种模式尤其有价值。
最关键的联动在于——你可以用 Tinker 来微调 Inkling。用户只需带上自己的数据,租用 Thinking Machines 的算力,即可在免费的基础模型上进一步做后训练和微调,尤其适合拥有多模态数据的场景。
此外,一个更值得期待的是 Inkling Small——一个 2760 亿参数、120 亿激活参数的较小版本,理论上更适合消费级硬件运行,不过具体可用时间仍待观察。
有意思的是,在自进化(self-evolution)研究方向上,团队甚至让模型使用 Tinker 框架和开源代码 harness 自己微调自己,这一探索颇为前卫。

实测体验:生成速度快但设计多样性不足
在 Playground 中,左侧可以设置推理力度(从 none 到最高),系统提示相对简单,训练截止日期为 4 月 26 日——对于如此规模的模型来说,这个数据新鲜度相当可观。
生成速度与工具调用能力
实测中模型响应极快。当要求它"联网搜索 Inkling 的信息并生成一个极简但精美的网站"时,它展现了完整的能力:给出推理轨迹、执行交错式函数调用(interleaved tool calling)、生成搜索查询并返回结果。
交错式函数调用是一种先进的 Agent 能力模式,指模型在生成回复的过程中可以多次穿插调用外部工具(如搜索引擎、代码执行器、API 等),而不是一次性规划好所有工具调用。具体流程为:模型先思考并发起第一次工具调用,获取结果后继续推理,根据新信息决定是否需要进一步调用其他工具,如此反复直到获得足够信息来生成最终答案。这比简单的单次工具调用(如传统的 function calling)更接近人类解决问题的方式——我们通常是边查资料边思考,而不是一开始就列出所有需要查询的内容。这种能力对构建复杂的 AI Agent 至关重要。
整个思考过程连贯且详尽,对于万亿级模型而言生成速度令人印象深刻。
设计能力的局限性
然而,一个明显的问题浮现出来:它生成的网站高度雷同。对同一提示的不同运行,产出的网页在设计风格上惊人地相似。即便要求它"自由发挥、重新设计",最终仍会回到同一套默认模板。这说明在"审美(taste)"层面,Inkling 仍有较大提升空间。这一现象在大模型领域并不罕见,通常与训练数据中设计风格的多样性不足、或强化学习阶段偏好数据过于集中有关——模型在优化过程中可能收敛到了一个"安全但单调"的设计模式。

编程代码生成能力
在编码任务上,Inkling 同样不是 SOTA,但足够可用。例如要求它创建一个实时追踪器(提供 API 端点),它能在对话中直接生成可运行的代码,定位结果虽略有偏差,但大体正确。
Inkling定价策略:中高价位但开源是核心优势
如果通过 Tinker 平台使用,Inkling 的定价分为两档(取决于 token 用量)。以 64K tokens 档为例,输入约 1.8 美分、输出接近 4.7 美元每百万 tokens——整体偏向中高价位,并不算便宜。
但别忘了它的核心优势:这是开源权重模型。如果你有足够算力,完全可以下载权重在自己的硬件上运行;如果使用 Tinker,则能以相对可控的成本进行微调和训练。

总结:Inkling开启西方开源多模态模型新篇章
Inkling 的意义远超其当下的 benchmark 分数。它标志着西方实验室在"前沿级 + 开源 + 原生多模态"这一空白地带迈出了第一步,为开发者提供了又一个不受制于中国实验室的开源选项。
作为第一代模型,它已经展现出快速、全面、多模态强势的特质,尽管在设计审美和编码顶尖水平上仍有距离。可以预见,随着后续迭代(尤其在多模态方向持续加强),Thinking Machines 有潜力推出更强大的版本。对于关注开源生态的从业者来说,这无疑是一个值得持续追踪的方向。
相关推荐

MLOps实战项目:衣物洗涤识别系统端到端构建全解析
通过一个衣物洗涤识别系统,详解MLOps端到端实战流程,涵盖自动化数据采集、模型再训练、Docker容器化、AWS云端部署以及Grafana+Prometheus监控,为MLOps初学者和求职者提供完整参考范本。

Row-Bot多智能体编排架构深度解析:父子Agent协作与并发控制
深入解析Row-Bot开源项目的多智能体编排架构,详解父子Agent分工模式、Git worktree并发安全机制、状态持久化与容错恢复设计,为AI Agent工程化落地提供可借鉴的协作范式。

Unsloth Desktop 发布:本地模型运行与训练一体化桌面应用
Unsloth Desktop 是一款开源跨平台桌面应用,集模型运行、微调训练、部署于一体,支持Mac/Windows/Linux,实现2倍训练加速与70%显存节省,零遥测保护隐私。