[控场AI]
· 4 分钟阅读· 2,168 字

用4美元让Claude Code自主造出解说视频:一次无人值守实测

用4美元让Claude Code自主造出解说视频:一次无人值守实测

Reddit用户用Claude Code无人值守两小时、花费4美元,自主生成一条完整产品解说视频。

一位Reddit用户近乎照搬他人提示词,让Claude Code在无人值守状态下运行约两小时,自主完成了产品解说视频的全部制作流程:脚本构思、拼贴美术生成、配音配乐、基于JavaScript Canvas的逐帧动画、动画与旁白的精确同步,以及调用第二个模型自审草稿并修复问题。整个流程在OpenRouter上仅消耗约4美元。作者对成品的评价是"不是皮克斯,但100%可用"。这一案例展示了AI Agent编排复杂多模态任务的当前水位:多模型协作的"生成-评审"机制已走向实用,成本结构被大幅压缩,而人类的核心贡献正在前移至提示词设计本身。

一次无人值守的AI创作实验

一位Reddit用户分享了他对Claude Code能力的真实测试,结果让他直言"下巴都惊掉了"。事情的起因很简单:他此前看到一篇名为"Made entirely with Opus 5.5"(完全用Opus 5.5制作)的帖子,好奇这套流程能否复现,于是决定亲自跑一遍。

他几乎逐字照搬了原帖作者的提示词(prompt),塞进Claude Code,配上一个设置了10美元上限的OpenRouter密钥,然后——直接走开,让AI自己干活。测试对象选的是他自己的小型副项目Friendr.nl,理由很实在:他需要一个真实的产品来做解说,而不是空对空的演示。

用他自己的话说:"重点不是这个App,而是这场测试。"

reddit source

AI在1.5到2小时里独立完成了什么

真正令人意外的是这套流程的完整度。在大约1.5到2小时的无人值守运行中,Claude Code自主完成了一整条视频制作的产线,几乎覆盖了从创意到成片的每个环节:

  • 写脚本和概念:先想清楚要讲什么、怎么讲;
  • 生成拼贴风格的美术素材:视觉资产由AI自己产出;
  • 制作配音、配乐和音效:声音层同样一手包办;
  • 用纯JavaScript canvas动画搭建整个视频,然后渲染导出为MP4;
  • 将每一个动画节拍与旁白台词同步,这是最考验细节的一步;
  • 调用另一个模型来审阅自己的草稿,发现问题后自行修复。

这里最有技术含量的两点,一是把动画节奏和语音精确对齐——这通常需要人工反复微调;二是引入"另一个模型当审稿人"的自我审查机制,相当于让AI给自己做质检,再根据反馈迭代。整个过程无需人类插手。

JavaScript Canvas动画是HTML5提供的一种基于<canvas>元素的2D图形绘制API,开发者可以用JavaScript代码逐帧绘制图形、文字和图像,并通过requestAnimationFrame等机制生成流畅的动画序列。相比传统视频制作软件(如After Effects),Canvas动画的优势在于整个制作流程都是代码驱动的——AI可以直接输出JavaScript文件,精确控制每一帧的内容和时序,再通过Puppeteer或FFmpeg等工具将渲染结果导出为标准MP4视频。这种"代码即动画"的范式,正是AI能够端到端接管视频制作流程的技术基础:文字、图形、时序全部以数据形式存在,AI的强项恰好在于处理和生成这类结构化内容。

成本只有约4美元

这场实验最抓眼球的数字是价格。尽管作者预留了10美元的额度上限,实际在OpenRouter上的花费只有大约4美元。做完英文之外,他又追加要求生成了一个英文版本,多花了大约半小时。

把这个成本放到传统内容制作的语境里对比会更直观:一段包含原创脚本、美术、配音、配乐、音效和逐帧同步动画的产品解说视频,若走常规外包路线,成本和周期都远不止于此。而这里,四美元、两小时、零人工干预。

作者对成品的评价相当克制也相当诚实:"这不是皮克斯,但作为一个真正的解说视频,它百分之百可用。"这句话点出了当前这类AI自主创作的定位——它未必能达到顶级工作室的艺术水准,但已经跨过了"能实际拿来用"的门槛。

这个案例说明了什么

抛开单次实验的偶然性,这个案例真正的价值在于它展示了AI Agent(智能体)编排复杂多模态任务的能力已经到了什么程度。它不是单点生成一张图或一段文字,而是把"脚本—美术—声音—动画—渲染—自审—修复"这条完整链路串了起来,并且自主决策、自主纠错。

值得留意的几个信号:

多模型协作正在成为常态。 让一个模型生产、另一个模型审查,这种"生成-评审"的分工模式显著提升了产出的可靠性,也是Agent工作流走向成熟的标志之一。

成本结构被重构。 四美元的边际成本,意味着这类内容可以被大规模、低门槛地生产,对独立开发者和小团队尤其友好。

人类角色前移。 在这个流程里,人类的核心贡献退到了"写好那条提示词"的位置上——作者自己也把所有功劳归给了原帖提示词的作者。提示词的质量,正在成为最终产出质量的关键杠杆。

当然,作为一次来自社区的单一实测,它的结果还需要更多复现来验证稳定性,成品质量也依赖具体项目和素材。但它至少清晰地传递了一个趋势:AI自主完成端到端创作任务,已经从概念演示走向了可用的实践。

OpenRouter是一个聚合多家AI模型供应商(包括Anthropic、OpenAI、Google等)的统一API网关,开发者只需一个API密钥和一套接口规范,就能按需调用不同厂商的模型,并按实际用量付费。它的计费模式以token消耗为单位,充值后设置消费上限即可防止超支——本文作者预设10美元上限正是这一机制的体现。对于需要在单一工作流中协调多个模型(如本案例中"生成模型+审查模型"的组合)的Agent应用而言,OpenRouter降低了跨模型编排的工程复杂度,同时让成本控制更加透明和可预测。

分享:

相关推荐