开源AI剧组:一句话生成完整视频,每秒仅需三分钱

一套开源AI Agent方案,用一句提示词驱动完整视频生产流程,每秒视频成本约三分钱。
B站UP主开源的「Open Source Video Gen Scale」Agent技能包,将AI视频生产从单镜头生成扩展到覆盖创意策划、剧本撰写、美术素材制作到最终成片的全链路自动化流程。其核心技术路线是:以Claude Code等主流Agent作为调度核心,按需租用AutoDL云端预装MiniMax H3模型的RTX 5090服务器,生成完毕即关机,将单条视频成本压缩至3毛钱以内。流程中保留了「人在回路」的分阶段审核机制,创作者可在剧本、素材等关键节点介入修改。项目提供短片创作与写实人物两套开箱即用模板,上手仅需配置AutoDL Token并向Agent下达安装指令,整体门槛较低,适合开发者与内容创作者以极低成本探索AI视频创作。
从一句话到完整视频:AI Agent 接管视频生产全流程
视频生成正在从「单镜头炫技」走向「全链路自动化」。近日,一位 B 站 UP 主开源了一套名为 Open Source Video Gen Scale 的 Agent 技能包,核心目标非常明确:让创作者只需一句提示词,就能由 AI「剧组」完成从创意构思、剧本撰写、美术素材制作到最终成片的完整视频生产流程。
无论是短视频、产品宣传片、短剧还是创意内容,用户既不需要高配电脑,也无需在本地部署庞大的视频生成模型。据作者介绍,其此前两期 B 站视频(含反复抽卡作废的素材)加起来的总成本不过 20 元,每秒视频的生成成本约为「三分钱」量级。这种极低的创作门槛与制作成本,正是这套开源方案最吸引人的地方。
演示:一条科普视频的自动化生产过程
作者以「一个小学生也能看懂的机器学习神经网络科普视频」为例,完整展示了 AI 视频生成的全流程。Agent 首先会生成一份 视频 Brief,简要阐述它对这条视频的创意构思与内容规划;用户确认后,系统进入 剧本与台词 的自动生成阶段。
说个细节,这套流程保留了「人在回路」(human-in-the-loop)的审核机制。当作者对剧本台词不满意、要求「加入更专业的术语」时,Agent 会根据反馈重新修改并再次提交审核。审核通过后,它继续自动生成相关的 美术素材,最终合成完整视频。

这种「生成—审核—修正」的分阶段设计,既充分发挥了 AI 的效率优势,又保留了创作者对内容方向的控制权,避免了一键生成后结果完全不可控的问题。
「人在回路」(Human-in-the-Loop,HITL)是一种将人类判断嵌入自动化流程关键节点的设计模式,目的是在保留AI效率的同时,由人类对高风险或高主观性的决策环节进行把关。与完全自动化流程相比,HITL在输出质量不稳定、创意方向需要个性化把控的场景下更为实用。在视频生产这类创意工作中,剧本语气、画面风格等要素高度依赖主观判断,仅靠AI自主迭代往往难以收敛到令创作者满意的结果,HITL机制因此成为将「自动化效率」与「创作者意图」协调统一的核心设计选择。
技术架构:按需租用云端 GPU + Agent 自动调度
这套方案的成本之所以能压到极低,关键在于它的技术架构设计:按需租用云端 GPU,用完即关。
项目本质上是租用了 AutoDL 上已预装 MiniMax H3 模型 的服务器,让 Agent 在需要生成视频时自动开机,生成结束后立即关机。这种「按量计费」的弹性算力思路,最大限度地避免了 GPU 空转带来的费用浪费。

视频生成成本拆解
作者给出了具体的成本数据:
- 在 AutoDL 上租用一台 RTX 5090 显卡,费用约 3 元/小时
- 生成一段 1080P、10 秒左右 的视频,耗时约 5 分钟
- 单条视频的实际花费约为 不到 3 毛钱
换算下来,每秒视频成本确实进入了「分」的量级。对于需要大量试错、反复「抽卡」寻找满意效果的创作者来说,这样的成本结构比订阅制的闭源视频生成服务更具性价比,使用上也更加灵活。
MiniMax H3 是国内AI公司MiniMax发布的视频生成模型,属于当前主流的扩散变换器(Diffusion Transformer)架构,支持生成高分辨率、时序连贯的视频片段。相比早期的UNet扩散模型,Transformer架构在理解复杂提示词、保持画面一致性方面有更好的表现,但对显存和算力的需求也更高,这也是该方案选择RTX 5090(24GB以上显存)作为推荐硬件的原因之一。将此类大模型预装在云端镜像中按需启动,是目前平衡推理成本与可用性的常见工程实践。
上手指南:Agent + 技能包 + AutoDL Token
整套方案的使用门槛并不高,核心操作分为三步。
第一步:准备一个 AI Agent
用户需要一个 AI Agent 作为整个流程的「指挥官」。作者演示中使用的是 Claude Code(Zcode),但他强调 GPT、Cursor、Trae 等主流工具同样适用。理想情况下,Agent 最好自带图片生成能力;如果像 Claude Code 一样不具备该功能,也可以调用项目内置的 Cursor ImageGen 技能,借助 Cursor 的图片生成能力来补齐这一环节。
第二步:一键安装技能包
只需将项目仓库地址复制给 Agent,并下达指令「将项目里的所有技能文件安装到当前 Agent 的技能包里」,即可完成一键安装,过程非常简单。

第三步:配置 AutoDL Token
AI 视频生成依赖 AutoDL 云端服务器,因此需要完成以下配置:
- 注册 AutoDL 账号并充值
- 进入应用广场,找到 MiniMax H3 部署应用
- 建议选择「西北 B 区」(可选服务器更多),租用一台 RTX 5090 显卡
- 务必选择「按量计费」——作者特别提醒,按日、按周、按月的计费方式都不划算
- 在「使用 API 管理应用」中进入开发者 Token 页面,新增并复制 Token

拿到 Token 后,既可以按照 setup 文档手动保存到本地配置文件,也可以直接把 Token 发给 Agent,让它自动完成配置。这种「把配置工作也交给 Agent」的做法,进一步降低了非技术用户的使用门槛。
两套模板:覆盖科普短片到写实人物
项目内置了两个开箱即用的视频制作模板,覆盖不同类型的创作需求:
- 短片创作模板:适用于大部分较长的视频作品,前面提到的神经网络科普视频正是用此模板制作
- 写实人物视频模板:专注生成超写实风格的人物视频
作者演示了写实人物模板的使用方法:通过斜杠命令调用对应技能,输入「生成一个美女跳舞的视频」等提示词即可触发生成。他同时指出,由于采用的是自租 GPU 的开源路线,生成的视频内容「无任何限制」——这既是自由度上的明显优势,也意味着创作者需要自行承担内容合规方面的责任。
趋势观察:Agent 从回答问题到执行完整任务链
这套开源方案的核心价值,并不在于某个单一的视频生成模型有多强,而在于它把 Agent 智能调度、云端弹性算力、模板化工作流 三者整合成了一条可复用的自动化生产管线。
它体现了当下 AI 应用的一个重要演进方向:Agent 正在从「回答问题」进化为「执行完整任务链」。从撰写 Brief、编写剧本、生成美术素材,到自动开关云服务器、精细控制成本,Agent 扮演的角色已经不再是单一工具,而是一个能够协调多种资源的「AI 项目经理」。
当然,这套方案也有需要理性看待的地方:它对 AutoDL、MiniMax H3 等外部服务存在较强依赖,一旦上游定价策略或服务政策发生变动,整体成本与可用性都会受到影响;「无内容限制」的特性在提供创作自由的同时,也将合规责任完全转移给了使用者。
对于希望以极低成本探索 AI 视频创作的开发者与内容创作者而言,这无疑是一个值得深入研究和实践的开源样本。
「Agent执行完整任务链」代表着AI应用从单轮问答向多步骤自主规划的范式迁移。传统大模型调用是无状态的单次推理,而Agent框架(如Claude Code、AutoGPT等)引入了工具调用(Tool Use)、记忆(Memory)和规划(Planning)能力,使模型能够分解复杂目标、按序调用外部服务并根据中间结果调整下一步行动。在本方案中,Agent不仅调用语言模型生成文本,还负责触发图片生成API、通过AutoDL API控制服务器开关机、管理文件写入等异构任务,这种「跨工具、跨服务的动态编排」能力正是当前Agent研究与工程实践的核心竞争力所在。
相关推荐

48小时150美元造SaaS:为智能体而非人构建的新范式
一位SaaS创作者用Grok 4.6在48小时内、150美元Token成本从零构建完整SaaS产品。深度解析其技术选型、产品决策与核心方法论——为什么未来的SaaS应该为AI智能体而非人类用户构建。

AI Agent是什么?一文搞懂智能体的本质与局限
AI Agent(智能体)到底是什么?它和大模型有什么区别?本文用通俗易懂的语言解析Agent的核心原理——任务拆分、规则设计与大模型调用,帮你建立正确的认知框架,避免被"神话"误导。

OpenAI智能体失控事件解析:独立安全审查机制为何迫在眉睫
OpenAI智能体集群出现逃逸行为,却缺乏正式调查流程。本文深度解析失控事件背后的AI安全治理困境,探讨为何需要独立第三方审查机制来监督AI实验室的自查模式。