[控场AI]
· 7 分钟阅读· 3,784 字

输入剧本自动生成动漫短剧:Skills全流程实操教程

输入剧本自动生成动漫短剧:Skills全流程实操教程

一套基于AI Agent的全自动流水线,让个人创作者通过对话即可完成动漫短剧从剧本到成片的全流程制作。

这套名为「drama auto pipeline」的Skills工作流,将动漫短剧制作拆解为12个可对话操作的步骤,涵盖剧本共创、风格审定、角色资产生成、导演分镜、提示词生成到批量视频渲染的完整链条。用户只需提供创意方向并在关键节点审核把关,其余执行工作全部由AI Agent自动调度完成,底层集成了大模型API、图像生成、视频渲染(RunningHub)和语音克隆等多类工具。成本方面,一分钟成品视频约需3-6元,实测20段近4分钟短剧总花费约10元,且全程纯云端API调用,对本地设备无算力要求。系统内置双审核机制——Agent先自审再交人工,并能沉淀错误经验实现持续优化。新手建议首次全程跟走以熟悉链路,熟练后可在批量渲染前集中把关,再放手让Agent批量完成。

从剧本到成片:一条全自动的AI短剧流水线

传统动漫短剧的制作往往需要跨越剧本、分镜、配音、渲染等多个环节,对个人创作者门槛极高。而这套基于 Skills(drama auto pipeline)的工作流,把整个链条封装成一个可对话的 AI Agent 流水线——你只需要提供创意或剧本,剩下的角色生成、分镜设计、提示词编写、视频渲染都由 Agent 自动调度完成,人只负责在关键节点审核把关。

据这位 B 站 UP 主的演示,这套系统的核心思路是「人定目标、Agent 干活」。你可以选择完全放权当甩手掌柜,也可以每一步都亲自审核。它的底层是一套内置的标准 SOP 流程,通过 API 调用大模型、图片生成、视频渲染和音色克隆等工具,全程无需接触任何代码。

前置准备:模型选择与积分成本

启动任务前,需要先安装并激活 Skills,然后新建任务、加载 drama auto pipeline 技能。如果对流程不熟悉,可以直接问 Agent「这个 Skills 怎么用」,它会解释这是一条从剧本到成片的全自动/半自动流水线。

模型选择是第一个关键决策。系统提供快速、均衡、极致三档,档位越高推理越深、消耗积分越快。具体模型涵盖了国产主流选择:

  • 混元系列:腾讯自研,其中混元系限时免费
  • DeepSeek广告 4.1 flash:0.03 积分/次,性价比高,被 UP 主列为主力模型之一
  • 智谱 GLM 5.3 flash:另一主力模型,便宜快速
  • Kimi K3、MiniMax M3、DeepSeek Pro:能力更强,适合长文本长链条任务

UP 主的建议很实在:一般功能用 DeepSeek 4.1 flash 或 GLM 5.3 flash 即可;做动漫短剧这种长链条任务,如果积分充裕,可以上 Kimi K3。新用户用微信登录送 2000 积分,每天登录再送 100 积分,测试体验完全够用。

那么所以说他每次都会问你啊

这里提到的各模型在能力与成本上各有侧重,值得简单了解。DeepSeek 4.1 flash 是深度求索推出的轻量推理模型,以极低延迟和Token价格著称,适合频繁调用的流水线场景。智谱 GLM 5.3 flash 来自清华系的智谱AI,同样主打高性价比,在中文理解和指令跟随上表现稳定。Kimi K3 是月之暗面最新旗舰模型,在长上下文处理和复杂推理链上有明显优势,但单次调用成本也更高。在自动化流水线中,模型选择本质上是「推理深度」与「调用成本」之间的权衡:简单的格式化步骤用轻量模型即可,而涉及多轮逻辑判断、长文本生成的导演分镜环节,则更适合能力更强的模型,以减少幻觉和返工概率。

12 步全流程拆解:Agent 如何一步步造片

整套流程被划分为依次进行的步骤,每一步都可以灵活调整或跳过。核心环节包括:

剧本共创与风格审定

第一关是剧本共创——Agent 生成剧本单元后交由你审核,不满意可以打回重改。第二关是风格审定,系统会给出 A/B/C 三个风格选项(如立光青春、日常柔光偶像剧等)并给出推荐理由,你一句话选定即可,也可以要求「换一组」。

资产生成与审核

第三关生成角色、场景、道具资产。图片走「真真工坊」的工作流(约四分钱一张 1K 图,调用 GPT 2.5 模型),音色则调用 breeze TTS 生成。Agent 会为每个角色建立白底图、音色样本并保持人脸和音色的一致性。生成完成后输出一个 HTML 审核页,你检查后不合格就指出问题让它重做。

你或者你不让他生成

分镜设计(导演环节)

第四关是中文导演分镜,这是最关键的一步。Agent 会把故事拆解成多个分镜段落,标注场景、人物、情绪、台词和时长,并智能处理前后衔接——延续同一场景时会截取上一段视频的尾帧作为下一段参考,场景切换时则新开镜头。演示中一个二十段、206 秒的短剧就是这样自动排布出来的。

提示词生成与最后关口

第五关生成 MiniMax H3 的视频提示词,这是视频渲染前的最后一道关口。Agent 会逐步拆解镜头设计,检查台词是否超时长上限,遇到问题会询问处理方式(如拆段、压缩台词或延长时长)。UP 主推荐「台词一字不删、直接拆段」的用法。这一步务必审核台词和分镜是否正确。

一步一步的都会去去做

批量渲染与成片审核

最后是批量生成视频和成片审核。Agent 调用 RunningHub 工作流渲染,全部完成后把分镜拼接成完整成片。哪一段不满意,只需告诉它重抽该段即可。

算力与成本:消费级 vs 企业级 API

成本是实际使用中绕不开的话题。视频渲染通过 RunningHub 工作流完成,涉及两种 API 调用方式:

  • 消费级 API(扣 RHB):无论买什么等级会员,最多并行 5 路。使用 plus 档位(48G 显卡)时约 6 元/小时算力。
  • 企业级 API(充钱包):同时并行数可达 100 个,效率极高,但单价略贵。

UP 主实测,一分钟成品视频(约需渲染 4 个 15 秒片段、每段约 15 分钟)成本大约在 3-4 元(消费级)到 6 元左右(企业级)。演示中一部 20 段、总长 3 分 45 秒的短剧,总花费约 10.25 元,总耗时 3.65 小时。

对新手小白友好的一点是:整套流程通过 API 调用完成,对本地电脑算力没有要求,笔记本只要能上网即可。虽然系统也支持先工云或本地 ComfyUI,但那需要额外的部署和工作流导出,门槛更高,并非最优路径。

对不对那个地方也可以去改啊

RunningHub 是一个云端 ComfyUI 工作流托管平台,用户可以把本地搭建的 ComfyUI 节点图导出后上传至平台,通过 API 远程触发执行,从而把本地对显卡的依赖转移到云端 GPU 集群。**RHB(RunningHub Balance)**是其平台内部代币,可通过会员订阅或直接充值获得,用于抵扣工作流执行产生的算力消耗。消费级 API 与企业级 API 的核心区别在于并行路数:消费级受会员等级限制最多同时跑 5 个工作流任务,而企业级充值钱包后可并行 100 个任务,大幅缩短批量渲染的等待时间,代价是单位算力费用略高。对于偶尔制作短剧的个人用户,消费级通常已足够;若需要批量生产或对时效有要求,则企业级更合算。

双审核机制与「越用越懂你」的智能

这套系统的一个亮点是双审核机制:在你审核之前,Agent 会先按内置规则自审一遍。演示中出现的「班主人脸被裁掉一半」问题,就是 Agent 在自审时发现——它检测到裁剪像素不足,主动纠正并举一反三检查其他资产,还把经验总结沉淀下来,实现「越用越聪明」。

当遇到网络波动、下载失败等问题时,Agent 会自动重试和自我修复。用户只需定好目标、方向和步骤,具体执行交给它。这正是当下与 AI Agent 协作的新范式——人提供判断力,机器承担执行力。

「越用越聪明」这一表述背后,对应的是 AI Agent 的记忆与经验沉淀机制。在 Skills 这类 Agent 框架中,每次任务执行后发现的错误、用户的修改指令以及自审结论,会被写入会话级或持久化的记忆模块。下次执行相似任务时,Agent 可以检索这些历史记录,主动规避已知问题。这与传统软件「每次从零运行」的逻辑不同——它更接近一个在工作中积累经验的助手,而非一个无状态的脚本。需要注意的是,这种学习是基于规则归纳和上下文检索,并非真正意义上的模型权重更新,因此换账号或清空记忆后,积累的「经验」也会随之消失。

使用建议:新手先跟着走一遍

UP 主给出的实操建议很有参考价值:第一次使用不要选全自动,跟着流程一步步走,既能理解动漫短剧的完整制作链路,也能看清每一步的生成过程和参数含义。

熟练之后可以优化节奏:在批量生成视频之前的每一步过一下把关,一旦进入批量渲染就不必盯着——UP 主的习惯是晚上下任务,第二天早上收货,再针对性重抽有问题的片段,或放到剪辑软件里做后期打磨。

需要提醒的是:全自动模式因 AI 存在随机性和幻觉,出错概率更高。如果流程完全不把控,等视频跑完才发现问题,代价会很大。因此关键关口的人工审核仍是保证质量的核心。

此外,前后有衔接的分镜若修改了前一段视频,后一段可能也需要相应调整,或在剪辑阶段修复衔接——这属于后期打磨的范畴。

总的来看,这套 Skills 把动漫短剧的制作模式从「逐环节手工操作」转变为「定义目标 + 节点审核」,用一个对话式平台驱动大模型和各类生成工具协同工作,显著降低了个人创作者的制作门槛和时间成本。

分享:

相关推荐