Claude Code自动生成视频章节进度条动画教程

视频剪辑中那些让人崩溃的重复劳动
做过视频的朋友一定深有体会:视频章节进度条动画看起来只是一个小小的装饰元素,但每次制作起来却异常繁琐。你需要手动选择背景颜色、调节蒙版、一根一根对齐刻度线和时间轴、打文字、居中、调字体……每做一个新视频,这套流程就要从头再来一遍。
B站UP主CinCin分享了一个思路:既然这件事情如此繁琐且高度重复,为什么不把它变成一个自动化的工作流?借助Claude Code的Skill机制和Remotion前端库,他实现了"扔一个字幕文件进去,自动生成章节进度条动画"的完整方案,并将其开源在GitHub上。

核心思路:用写代码的方式做视频动画
为什么选择代码而非剪辑软件?
这个方案的核心理念很简单——让AI做它擅长的事情。在剪辑软件里拖拽、对齐、调参数,这些操作对AI来说并不友好;但写代码生成动画,恰恰是AI的强项。
具体来说,方案使用了Remotion——一个基于React的视频生成前端库。Remotion由Jonny Burger于2021年创建并开源,它的核心理念是"用React写视频"。传统视频制作依赖时间轴拖拽,而Remotion将视频的每一帧都视为一个React组件的渲染结果——你可以用JavaScript精确控制第几帧显示什么内容、触发什么动画。它内置了interpolate()插值函数和spring()弹性动画等工具,开发者可以像写网页动画一样编写视频动画,最终通过FFmpeg渲染为MP4文件。这种方式特别适合需要批量生成、参数化控制的视频场景。
从技术架构来看,Remotion的渲染管线分为两层:前端层使用React的协调机制(Reconciler)逐帧生成DOM快照,后端层通过Puppeteer(一个无头浏览器自动化工具)截取每帧画面,最终交由FFmpeg编码为视频文件。这意味着开发者可以利用整个React生态——包括状态管理、CSS-in-JS、SVG动画库等——来构建视频内容。Remotion还提供了Lambda云渲染方案,可以将长视频拆分为多个片段并行渲染,大幅缩短输出时间。截至2025年,Remotion在GitHub上已获得超过2万颗星,被Shopify、Spotify等公司用于自动化生成营销视频和数据可视化动画。这种广泛的行业采用验证了"用代码做视频"这一范式的可行性。
在这个方案中,每个进度条动画本质上就是一个React组件,改一个参数风格就变了,换一组时间戳新的进度条就出来了。每一次都只是在改参数,而不是整个重来。
更关键的是,用代码方式可以精准计算每一帧,这是手动剪辑很难做到的精度。

Claude Code Skill机制让工作流可复用
Claude Code是Anthropic推出的命令行AI编程助手,而Skill机制是其中一个让用户将常用工作流封装为可复用模块的核心功能。具体来说,一个Skill通常包含一组预定义的系统提示词(system prompt)、代码模板和执行逻辑。当用户安装某个Skill后,Claude Code会将这些预设加载到上下文中,使AI在后续对话中能够按照特定的工作流程执行任务。这类似于给AI装上了一个"专业插件"——它不再需要你每次从零开始描述需求,而是已经理解了整套流程的上下文。Skill可以通过链接分享和安装,这使得社区中的最佳实践能够快速传播和复用。
从技术实现来看,Skill机制本质上是一种**"上下文工程"(Context Engineering)**的实践。每个Skill由一组Markdown格式的指令文件组成,存储在项目的.claude/目录下。当Skill被激活时,这些指令会被注入到Claude的系统提示词中,相当于为AI预加载了领域知识和操作规范。与传统的IDE插件不同,Skill不依赖特定的编程语言或框架——它是纯粹的自然语言指令集,这使得非程序员也能创建和分享自己的工作流。Anthropic在2025年推出的Skill共享机制允许用户通过URL一键安装他人发布的Skill,这催生了一个类似"AI工作流应用商店"的社区生态,用户可以像安装手机App一样获取各种专业能力。这种设计理念与近年来"低代码/无代码"平台的兴起一脉相承——降低技术门槛,让领域专家而非程序员成为工作流的定义者。
CinCin将视频章节进度条的生成逻辑封装成了一个Skill,安装后在Claude Code中输入skill命令即可查看和使用。这意味着任何人只要安装了这个Skill,就能立即获得同样的自动化能力,而不需要理解底层的代码实现。
实际操作演示:从字幕到动画只需几步
第一步:导出SRT字幕文件
打开剪辑软件,将视频的带时间戳SRT字幕文件导出。SRT(SubRip Subtitle)是最常见的字幕文件格式之一,几乎所有主流剪辑软件和播放器都支持。它的结构非常简单:每条字幕由序号、时间戳和文本三部分组成,时间戳精确到毫秒,格式为"小时:分钟:秒,毫秒 --> 小时:分钟:秒,毫秒"。正因为SRT是纯文本格式且结构规整,AI可以非常容易地解析其中的时间信息和文字内容,进而根据语义自动判断哪些段落属于同一个章节。这也是为什么CinCin选择SRT作为输入——它既是剪辑软件的标准输出,又是AI最容易处理的结构化数据之一。
SRT之所以成为AI视频工作流的理想输入格式,除了其结构简单外,还有一个重要原因:它天然携带了时间维度的语义信息。相比ASS/SSA等富格式字幕(包含样式、位置、特效等渲染指令),SRT的纯文本特性使得token消耗极低——一个小时的视频字幕通常只有几KB,远低于大语言模型的上下文窗口限制。此外,现代语音识别工具(如OpenAI的Whisper、剪映的语音转文字功能)都能直接输出SRT格式,这意味着从"语音→字幕→章节划分→动画生成"的整条链路可以完全自动化,人类只需在关键节点做确认和微调。值得一提的是,Whisper模型本身也是开源的,开发者可以在本地部署,避免将敏感内容上传至云端,这对于涉及商业机密或未发布内容的视频制作尤为重要。

第二步:让AI自动划分章节
将字幕文件扔给Claude Code(或Codex),它会自动分析内容并提出章节划分建议。AI在这一步做的事情本质上是自然语言理解——它阅读字幕中的文字内容,识别话题转换的节点,然后结合时间戳给出章节边界。这一过程涉及到大语言模型的文本分割(Text Segmentation)能力:模型需要理解上下文语义的连贯性,判断哪里发生了主题切换。例如,当字幕内容从"产品功能介绍"过渡到"使用教程"时,AI能够识别出这是两个不同的章节。这种能力得益于大语言模型在海量文本上的预训练,使其对文章结构和话题边界有着天然的敏感度。
从NLP研究的角度来看,文本分割是一个经典的序列标注问题。早期方法依赖TextTiling等基于词频变化的统计算法,而现代大语言模型则通过注意力机制(Attention Mechanism)捕捉长距离的语义依赖关系,能够在更抽象的层面理解话题的起承转合。在视频字幕的场景中,这种能力尤其有用——因为口语化的表达往往缺乏书面文章中清晰的段落标记(如小标题、空行),AI需要从语义层面而非格式层面来判断章节边界。此外,大语言模型还能根据视频的整体主题和常见结构模式(如"引言→正文→总结")来优化划分方案,这是传统统计方法难以做到的。
当然,你也可以直接口头告诉AI你想怎么划分,比如"0分0秒是开场,1分钟是第一部分,1分50秒是第二部分"。
AI会给出它认为合理的划分方案,你确认后继续下一步。
第三步:选择风格并一键生成
确认章节划分后,AI会询问你想要的风格、比例(横屏/竖屏)以及位置(顶部/底部)。目前项目内置了六种进度条动画风格:
- 默认风格:经典的章节进度条,带主标题和小标题
- 底部进度条:将进度条放置在画面底部
- 破折号风格:简洁的破折号分隔样式
- 极简风格:不显示章节名称,只做进度划分
- 文字高光风格:当前章节文字高亮显示
- 矢量动画风格:可以放一个小矢量图(比如小螃蟹)跟随进度条移动
选好参数后,AI会自动修改配置文件中的参数,生成对应的进度条动画。由于底层是Remotion框架,所有风格本质上都是不同的React组件,切换风格只是切换组件和传入不同的props参数。这种组件化设计的好处在于高度可扩展——如果你想创建全新的风格,只需编写一个新的React组件并注册到风格列表中,无需修改任何已有代码。这种设计模式在软件工程中被称为"开闭原则"(Open-Closed Principle)——对扩展开放,对修改关闭。它确保了开源社区可以持续贡献新风格,而不会破坏现有功能。在实际操作中,一个新风格组件通常只需要100-200行TypeScript代码,定义进度条的布局、颜色方案、动画曲线和文字排版即可。
最后点击Render按钮即可导出视频文件。

自定义贴纸和Logo玩法
CinCin还展示了一个有趣的自定义案例:他把自家狗狗的照片上传给Krea(一款AI图像处理工具,支持智能抠图、风格迁移等功能),自动抠图并加上黄色描边,然后将这个贴纸嵌入进度条动画中。Krea背后使用的是基于扩散模型(Diffusion Model)的图像分割技术,能够精准识别前景主体并生成透明背景的PNG图像,这比传统的绿幕抠图或手动钢笔工具抠图效率高出数个量级。
这意味着你可以上传任何贴纸、Logo或照片,打造专属的进度条风格。这种个性化能力对于品牌化内容尤为重要——YouTube上的头部创作者往往有统一的视觉识别系统(Visual Identity System),包括固定的配色方案、字体和图标元素。而自动化工具能确保每期视频的进度条风格保持一致,同时又允许灵活调整。从品牌运营的角度看,这种"模板化+个性化"的组合正是规模化内容生产的最佳实践——它在保持品牌一致性的同时,避免了视觉疲劳。
更深层的思考:构建可复用的创作资产
这个项目的价值不仅仅在于一个进度条动画工具,更在于它背后的工作流自动化思维。
CinCin提出了一个值得每个内容创作者思考的原则:在日常工作中,只要发现一件事情需要重复做,就要思考能不能把它变成一个可复用的东西。
这一原则在软件工程领域有一个经典的对应概念——DRY原则(Don't Repeat Yourself)。它最初由Andy Hunt和Dave Thomas在《程序员修炼之道》中提出,核心思想是"系统中的每一项知识都应该有一个单一、明确、权威的表示"。CinCin所做的,本质上是将DRY原则从代码领域延伸到了内容创作领域:进度条的视觉设计是"知识",章节划分的逻辑是"知识",这些知识不应该每次都从零开始手动重建,而应该被封装、参数化、复用。
视频章节进度条是这样,字幕动画也是这样,还有很多重复繁琐又没有创造价值的工作,都可以用同样的思路来解决。每做一个Skill,就相当于给工作流增加了一块积木,慢慢地你就能把时间和精力释放出来,专注于真正有创造性的工作。
这也呼应了他之前提出的观点:用写代码的方式做视频,是未来视频制作要走的方向。 事实上,这一趋势在行业中已经逐渐显现。除了Remotion,业界还有Motion Canvas(基于TypeScript的动画引擎,专注于代码驱动的解释性动画)、Manim(3Blue1Brown创建的Python库,专门用于数学和科学可视化动画,其优雅的动画效果影响了整整一代教育视频创作者)等程序化视频工具。大型平台也在布局:Canva收购了视频自动化公司,Adobe推出了基于模板的批量视频生成功能,甚至传统的视频特效巨头After Effects也在2024年引入了脚本化动画的增强支持。核心趋势是将视频制作从"手工艺"转向"参数化生产"——设计师定义模板和风格,AI负责填充内容和渲染输出。
从更宏观的视角来看,程序化视频制作的兴起与内容产业的结构性变化密切相关。YouTube每分钟上传超过500小时的视频,TikTok日均上传量以百万计——在这种规模下,纯手工制作的效率瓶颈日益凸显。程序化方法的核心优势在于**"一次设计,无限复用"**:设计师创建一套视觉模板(相当于代码中的组件),内容团队只需更换数据源即可批量产出。这种模式在新闻类视频(如自动生成的体育赛事集锦,ESPN和BBC已大规模采用)、电商视频(基于商品数据自动生成展示视频,阿里巴巴的"鹿班"系统每天生成数百万张商品图和短视频)和教育内容中已经大规模应用。值得注意的是,这并非要取代创意性的视频制作,而是将创作者从"装配线工作"中解放出来——正如CinCin所强调的,自动化处理的是那些"重复繁琐又没有创造价值"的环节。真正的创意决策——叙事结构、情感节奏、视觉风格的定义——仍然需要人类创作者的判断力和审美直觉。
不是说每个创作者都要学编程,而是借助AI的代码能力,将重复性的视觉制作工作自动化,让创作者回归创意本身。
如何开始使用这个进度条动画工具
- 在GitHub上获取该Skill的安装链接(原视频评论区有提供)
- 在Claude Code或Codex中执行安装命令
- 准备好你的SRT字幕文件或手动指定章节划分
- 选择风格、比例和位置,一键生成
对于经常制作视频的创作者来说,这个工具能显著减少在重复性装饰动画上花费的时间。而对于所有使用AI工具的人来说,"把重复工作封装成可复用资产"的思维方式,或许比工具本身更有价值。
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。