Claude Fable 5.1动画生成实测:一只鹈鹕背后的大模型能力评估

Claude新版本生成动画鹈鹕的趣味测试,折射出大模型代码与创意能力的真实进步。
Hacker News上一则用Claude生成动画鹈鹕的帖子,引出了AI社区一个流行的非正式测试传统:通过要求模型生成SVG或动画代码来绘制特定物体,直观检验其空间理解、代码生成与创意表达能力。这类任务无法靠模板套用完成,既考验模型将语义概念转化为可执行代码的能力,也考验其审美判断力。文章进一步指出,此类社区驱动的「去正式化」测试正成为传统标准基准(如MMLU、HumanEval)的有效补充,更贴近真实使用场景且难以被刷分。与图像扩散模型相比,LLM生成结构化代码的路径具有可编辑、可集成的工程优势,代表了人机协作创作门槛持续降低的清晰信号。
从一只动画鹈鹕说起
近日,Hacker News 上一则标题为「Claude Fable 5.1 made me a nice animated pelican」的帖子引发了社区的讨论。发帖者展示了使用 Claude 新版本生成一只动画鹈鹕(pelican)的成果,虽然内容看似轻松有趣,但背后折射出的是当下大语言模型在代码生成与创意可视化领域的持续演进。
这类「让 AI 画一只鹈鹕」的测试并非偶然。它实际上延续了 AI 社区一个流行的基准测试传统——通过要求模型生成 SVG 或动画代码来绘制特定物体,以此直观检验模型的空间理解能力、代码生成质量以及创造性表达。鹈鹕之所以成为热门测试对象,源于知名开发者 Simon Willison 长期使用「让模型画一只骑自行车的鹈鹕(pelican riding a bicycle)」作为衡量各家大模型能力的趣味标尺。

为什么「画鹈鹕」是个有意思的测试
看似简单,实则综合
让模型「画一只动画鹈鹕」这个任务,对人类来说是天马行空的创意活动,但对 AI 而言却是一项复合能力的集中考验:
- 语义理解:模型需要准确理解「鹈鹕」这一生物的外形特征,包括其标志性的长喙和喉囊。
- 代码生成:将视觉概念转化为可执行的代码(如 SVG、CSS 动画或 Canvas/JavaScript),并保证语法正确、可以直接运行。
- 动画逻辑:「animated」意味着模型还需处理时间维度上的变化,设计出合理的运动帧或过渡效果。
- 审美判断:发帖者用了「nice」来形容结果,说明输出不仅要「能跑」,还要在视觉上具备一定的协调性和美感。
这种测试的价值在于,它无法通过简单的记忆或模板套用来完成,而是真实反映了模型在抽象到具象转换上的能力边界。
SVG(Scalable Vector Graphics)是一种基于XML的矢量图形格式,可以直接嵌入HTML页面并通过代码控制形状、路径和动画。CSS keyframes动画则允许开发者定义元素在时间轴上的状态变化,实现平移、旋转、缩放等效果。对于大语言模型而言,生成SVG动画的难点在于坐标系统的空间推理——模型需要在脑中「构建」鹈鹕的各个部位(身体、翅膀、喙、喉囊),用数值路径精确描述其轮廓,再为翅膀拍动等动作设计合理的变换参数。这与生成文字或解题有本质不同:错误的坐标会导致图形变形或组件错位,而模型无法在生成时「看到」自己的输出结果进行视觉校正。
社区反响如何
该帖获得了 34 个点赞和 7 条评论。在 Hacker News 这样以技术从业者为主的社区,这类分享虽然规模不大,但往往能引发关于模型能力对比的深入讨论。用户通常会自发对比不同模型(如 GPT、Gemini、Claude 各版本)在同一任务上的表现差异,形成一种民间基准测试的氛围。
Claude Fable 5.1 意味着什么
需要说明的是,「Claude Fable 5.1」这一命名在原帖中出现,可能是社区对某个 Claude 变体或内部版本的称呼。无论具体版本如何,它所代表的趋势是清晰的:Anthropic 的 Claude 系列在代码生成和创意任务上正持续迭代。
从技术角度看,能够生成「不错的动画鹈鹕」,至少说明该版本具备以下特质:
- 前端代码能力扎实:动画通常依赖 SVG 动画、CSS keyframes 或 JavaScript,能生成可运行的动画代码说明模型对前端技术栈有良好掌握。
- 创意表达的稳定性:从「能画」到「画得好看」之间存在巨大鸿沟,后者要求模型对形状、比例、色彩有更细腻的把控。
- 指令遵循度高:用户明确要求「animated」(动画)和「pelican」(鹈鹕),模型准确响应了这两个关键约束。
从趣味测试看大模型的真实进步
基准测试的「去正式化」趋势
这类「画鹈鹕」测试代表了一种有趣的现象:AI 能力评估正在从严肃的标准化 benchmark,向轻量、直观、可复现的社区测试延伸。传统基准如 MMLU、HumanEval 固然重要,但它们的分数对普通用户而言过于抽象。相比之下,「你能不能画一只好看的动画鹈鹕」这样的任务,任何人都能一眼判断结果好坏。
这种去正式化的测试有其独特价值——它更贴近真实用户的使用场景,也更容易在社交媒体上传播,从而形成对模型能力的直观口碑。
MMLU(Massive Multitask Language Understanding)是覆盖57个学科的选择题集,用于衡量模型的知识广度;HumanEval则是由OpenAI发布的代码生成基准,包含164道编程题,以代码能否通过单元测试为评判标准。这些正式基准的局限性在于:其题目固定、数据可能泄漏进训练集,且高分不一定意味着用户体验好。「画鹈鹕」这类社区测试恰好弥补了这一盲点——任务开放、答案无唯一解,且评判标准回归到人的直觉感受,更难被「刷分」,也更能反映模型在开放性创作任务中的真实水平。
代码即创意:与图像生成模型的本质区别
值得关注的是,AI 通过生成代码来创作视觉内容,代表了一种与图像扩散模型(如 Midjourney、DALL-E)截然不同的路径。扩散模型直接输出像素图像,而 Claude 这类大语言模型输出的是可编辑、可缩放、结构化的代码。
这意味着生成的动画鹈鹕不是一张静态图片,而是一段可以被开发者继续修改、集成到网页中的实际资产。对于前端开发者和设计师而言,这种「代码优先」的创意生成方式具有更强的实用性和可控性。
图像扩散模型(Diffusion Model)的工作原理是通过迭代去噪将随机噪声逐步还原为图像,输出的是像素点阵。这类模型在生成逼真图像方面表现出色,但输出结果本质上是一个不透明的「黑盒图片」——无法直接编辑某个局部,也无法提取内部的结构信息。相比之下,LLM生成的SVG或JavaScript动画代码具有完整的语义结构:开发者可以找到代表「翅膀」的路径元素,单独修改其颜色或动画速度,或将其拆解后复用到其他项目中。这种结构化、可编程的输出方式,使LLM在工程场景下的「创意生成」具有扩散模型难以替代的优势。
小测试,大信号
一只动画鹈鹕看似微不足道,但它是观察大模型能力演进的一个鲜活切片。当 AI 能够越来越轻松地将一句自然语言指令转化为运行流畅、视觉悦目的动画代码时,我们看到的是人机协作创作门槛的持续降低。
对于开发者和创意工作者来说,这类能力的进步意味着在原型设计、可视化演示、教学素材制作等场景中,AI 将扮演越来越重要的角色。而对于整个 AI 行业而言,这些来自社区的趣味测试,正以一种轻松却真实的方式,记录着技术前进的每一步。
相关推荐

@ai-sdk/zai@3.0.10 发布:依赖更新的补丁版本解析
Vercel AI SDK 发布 @ai-sdk/zai@3.0.10 补丁版本,同步更新 provider、provider-utils 与 openai-compatible 等底层依赖。本文解析该版本变更内容及 AI SDK provider 体系的设计意义。

Vercel AI SDK 更新:@ai-sdk/workflow 2.0.29 修复工具结果保留问题
Vercel AI SDK 发布 @ai-sdk/workflow 2.0.29 补丁版本,核心修复工作流在终止、延迟、暂停三种响应状态下 provider 工具执行结果的保留问题,并同步升级 ai@7.0.98 等核心依赖。

Vercel AI SDK 更新:@ai-sdk/xai 4.0.58 批处理与图像生成改进
Vercel AI SDK 发布 @ai-sdk/xai 4.0.58 版本更新,新增批处理图像生成支持,修复批处理请求类型校验及 DeepSeek 推理流问题,并同步升级 provider 相关依赖。