[控场AI]
· 6 分钟阅读· 3,325 字

英伟达 Kimodo AI 动画生成器 CPU 本地部署完全指南

英伟达 Kimodo AI 动画生成器 CPU 本地部署完全指南

C++移植版Kimodo CPP将AI动画生成门槛降至2GB显存或纯CPU,并打通了导入游戏引擎的完整链路。

Kimodo CPP 是社区开发者对英伟达文本到动画模型 Kimodo 的 C++ 移植版,核心价值在于将运行门槛从高端显卡拉低至最低 2GB 显存乃至纯 CPU 环境。代价是速度:3 秒动画在纯 CPU 下约需 5 分钟。Windows 安装依赖 C++ Build Tools、Vulkan SDK、Golang 和 Git,配合 AI Agent 读取安装文档可显著降低操作难度。骨架选择方面,原有的 SMPLX 骨架禁止商用,新版已增加更精细的 Soma 和 G1 骨架作为替代。生成的动画可导出为 GLB 格式,经由 Mixamo 骨架重定向后顺利导入 Unreal Engine,目前主要短板是缺乏手指动画。整体来看,这套工具链已基本打通从文字描述到游戏引擎可用动画的完整流程,对独立开发者和小团队具有较高实用价值。

英伟达的 AI 动画生成器 Kimodo(视频中读作 Kimoto/Komodo)终于摆脱了对显卡显存的强依赖。得益于一位名叫 Richard Pellentropi 的开发者贡献的 C++ 移植版本 Kimodo CPP,现在普通用户可以在纯 CPU 或极低显存的设备上跑起这款高质量的文本到动画模型。这意味着 AI 动画生成正在被真正意义上地"平民化"。

本文基于 B 站 UP 主的实测演示,整理出这套工具的硬件要求、安装流程、可用骨架方案,以及如何将生成的动画导入 Unreal Engine 等游戏引擎的完整路径。

Kimodo CPP 究竟解决了什么问题

原版 Kimodo 高度依赖显存,显存越大性能越好,这把大量没有高端显卡的用户挡在了门外。而 Kimodo CPP 这个 C++ 移植版最核心的价值,就是把运行门槛打了下来。

它可以完全跑在 CPU 上,也可以用极小的显存运行——最低仅需 2GB 显存,而且这个版本对显存的增加并不像原版那样敏感。UP 主实测确认:他在纯 CPU 环境下跑通了,也把自己的 12GB 显卡人为限制到 4GB 后跑通了,还有其他用户在真实的 4GB 至 6GB 显卡上验证成功。

代价当然是速度。以最低配置为例,一段 3 秒的动画在纯 CPU 下大约需要 5 分钟,2 至 4GB 显存的表现也差不多。换句话说,你用运行速度换来了"人人可跑"的自由度,这对没有专业硬件的创作者来说是一笔划算的交易。

需要注意,虽然显存要求降低了,但内存(RAM)最低仍需 4GB,模型权重本身约占 25GB 存储空间,这一点不能省。

Windows 下的安装流程

Kimodo CPP 托管在 GitHub 上,默认面向 Linux 设计,但移植到 Windows 并不复杂,UP 主已经亲自跑通并整理了完整步骤。

我把 Windows 上运行所需的全部安装步骤都整理好了

从演示来看,核心依赖包括:

  • C++ Build Tools:因为需要在本地设备上直接编译构建
  • Vulkan SDK
  • Golang(Go 语言支持)
  • Git:如果尚未安装需先装好

此外还需要下载两个模型:Llama 3 的 Kimodo GGML 权重,以及用于驱动的骨架(skeleton)模型。

UP 主给出的一个省心技巧值得一提:他把所有安装步骤整理成了 Markdown 文件,建议直接把这个 .md 文件丢给 Cloud Code 或 ChatGPT 之类的 AI Agent,让它替你完成整个安装流程并处理过程中遇到的报错。对不熟悉命令行编译的用户,这是降低操作门槛的实用做法。

骨架选择与商用授权问题

骨架(skeleton)是这套工具中一个容易踩坑的地方,涉及授权合规。

你可以在这里查看各骨架的相关信息

最初 Kimodo CPP 首发版本只支持 SMPLX 骨架,但该骨架的授权协议不允许商用。这是很多人关心的重点。好消息是,在 UP 主录制视频前一天,项目更新增加了更多骨架选项,目前一共有四种可选。

除了不建议使用的 SMPLX 之外,现在可以选择 Soma 或 G1 骨架。UP 主认为这两种骨架实际上更精细,拥有更多骨骼,最终动画质量也更好。他自己在本地把所有骨架都装了一遍做对比,最终选定 Soma RP v1.1 作为主力方案。

从工具界面看,用户有一个提示词(prompt)输入窗口,可以设置帧数,默认推理步数为 20 步——步数越高"思考"越久。除了 GUI,也支持无界面运行,通过命令行控制步数、帧数和提示词。其中 Komodo text layer chunk 参数可以设置为 CPU,从而强制使用 CPU 运算。

SMPLX(SMPL-eXpressive)是由马克斯·普朗克智能系统研究所开发的参数化人体模型,能够表达身体姿态、手部动作和面部表情,在学术动作捕捉领域被广泛使用。然而其授权协议属于非商业研究许可(NC license),这意味着任何以盈利为目的的产品、游戏或商业项目都不能使用它生成的资产。Soma 骨架是专为动画绑定设计的开源方案,关节层级更接近主流游戏引擎的惯例,骨骼数量通常在 65 根以上,能够承载更细腻的肢体扭转权重。G1 则是另一套社区维护的通用人形骨架,设计上兼顾了与 Mixamo 和 UE5 Mannequin 的兼容性。选择这两者而非 SMPLX,既能规避法律风险,也为后续的骨架重定向省去了额外的关节映射工作。

导出 GLB 与导入游戏引擎

生成动画的最终目的,往往是拿到 Blender 或游戏引擎里去用,所以导出格式和骨架重定向(retargeting)是关键环节。

之前版本无法导出 GLB,新版已原生支持

早期版本无法导出 GLB 格式,而 UP 主拿到的最新版本已经在 UI 中原生支持导出 GLB。如果你的版本还没有这个功能,同样可以借助 AI Agent 来补上。

由于 Soma、G1 这类骨架不能直接用于游戏,UP 主借助 AI 工具完成了动画的骨架重定向工作。他先用 SMPLX 骨架跑通流程,再改写到 Soma;随后测试了向 Mixamo 骨架的重定向,而从 Mixamo 又能进一步重定向到任意其他骨架。最终他把这些动画成功导入了 Unreal Engine,实测效果不错。

动画中手部动作较少,处于放松姿势

目前唯一明显的短板是没有手指动画。所有生成的动画里手部基本处于放松姿势,缺少细致的手指动作。UP 主提到,Unreal Engine 5.8 新增了无标记点(markerless)动作捕捉功能,能够追踪手部动作,可以作为弥补这一缺陷的思路之一。

**骨架重定向(Retargeting)**是将一套骨骼动画数据映射到另一套不同拓扑结构骨骼上的过程。由于不同骨架的关节命名、数量和初始姿态(T-pose 或 A-pose)各不相同,直接复制关键帧数据会导致严重的肢体错位。Mixamo 骨架之所以在这条链路中充当"中转站",是因为它是目前游戏行业覆盖面最广的标准化人形骨架之一,Unreal Engine、Unity 以及绝大多数角色资产都提供了到 Mixamo 的预置重定向配置。先将 Soma/G1 动画重定向到 Mixamo,再从 Mixamo 重定向到目标骨架(如 UE5 Mannequin),可以最大程度复用现有的重定向资产,避免手动逐关节配对的繁琐工作。GLB 是 glTF 二进制格式,能在单个文件中同时打包骨骼、蒙皮权重和动画数据,是当前跨平台三维资产交换的主流格式,Blender、Unreal Engine 和 Unity 均原生支持导入。

AI 动画的民主化进程

综合来看,Kimodo CPP 的意义不在于性能超越原版——纯 CPU 运行确实更慢,无法充分受益于大显存——而在于它把这项能力交到了更多普通用户手中。

最近的更新还一并解决了授权问题(可用 Soma / G1 骨架)和导出问题(原生 GLB 导出),让这条从生成到落地游戏引擎的链路真正打通。对独立开发者、动画爱好者和小团队而言,能够本地、免费、离线地生成高质量动画,是一个实打实的利好。

如果你想上手,UP 主已经把所有链接、说明文档和 Markdown 安装文件整理好并免费提供,最简单的方式仍然是把这些文件交给 AI Agent 代劳完成部署。

分享:

相关推荐