创意写作AI排名引热议:基准测试真的可信吗

一则排名引发的争论
近日,一则关于Gemini 3.7 Flash的讨论在Reddit上引发热烈反响。据称,Gemini 3.7 Flash在创意写作能力上位列全球第三,仅略逊于Fable模型。然而,这个看似客观的排名却激起了社区的强烈质疑——不是质疑Gemini,而是质疑整个创意写作基准测试的可信度。
争论的焦点在于榜单中Claude模型长期霸榜的现象。一位用户直言不讳地表示:"只要Claude模型还占据榜首,我就不信任这些基准测试。我实在受不了Claude的写作方式,无论怎么调整指令,它听起来都像个机器人。"在这位用户看来,Kimi K3甚至新推出的DeepSeek PRO在创意写作上都远胜Claude。
这场看似关于单个模型的讨论,实际上揭示了AI创意写作评估中一个更深层的难题:创意写作的质量,究竟能不能被客观衡量?
主观性:创意写作评估的核心困境
针对上述批评,有用户提出了截然相反的观点:"在我的体验里恰恰相反,我认为Claude模型才是创意写作最强的。"这种针锋相对的评价恰恰印证了问题的本质——创意写作是高度主观的。
正如一位评论者一针见血地指出:"创意写作高度主观,这正是我认为对创意写作做基准测试毫无意义的原因,因为每个人对什么是最好的模型都有不同看法。"
当前AI创意写作的基准测试主要包括几种范式:一是基于自动化指标的评估,如困惑度(Perplexity)、BLEU分数、ROUGE分数等,这些指标最初为机器翻译设计,在衡量创意性方面存在天然缺陷。困惑度衡量的是语言模型对测试文本的预测能力,数值越低表示模型越"不惊讶"于看到这些文本,但低困惑度可能意味着模型只善于生成常见的、可预测的文本,而创意写作恰恰需要出人意料的表达。BLEU通过计算生成文本与参考文本的n-gram重叠来衡量相似度,ROUGE则关注召回率——这些指标假设存在"标准答案",但创意写作的本质就是不存在唯一正确的表达方式,同一个故事提示可以有无数种精彩的展开方式。值得注意的是,近年来研究者已开发出更针对创意文本的自动化指标,如衡量词汇多样性的TTR(Type-Token Ratio)、衡量语义新颖度的BERTScore变体等,但这些指标在捕捉叙事结构和情感共鸣方面仍力不从心。
二是基于人类偏好的竞技场模式(如Chatbot Arena),用户对两个匿名模型的输出进行盲选投票,通过ELO评分体系生成排名。ELO评分源自国际象棋的排名系统,由匈牙利裔美国物理学家Arpad Elo于1960年代发明,通过成对比较计算相对实力,每次对局后根据预期胜率与实际结果的差异调整双方分数。在AI评估语境下,每次用户投票相当于一局"对弈"。然而,该系统假设参与者的实力是稳定的,这在AI模型频繁更新的背景下并不完全成立;且对投票者质量高度敏感——如果大量投票者缺乏文学鉴赏力,排名可能反映的是"通俗偏好"而非"写作质量"。ELO系统在AI评估中还面临一个被称为"不可传递性"(Intransitivity)的问题:模型A可能在风格上胜过模型B,模型B胜过模型C,但模型C却可能胜过模型A——就像剪刀石头布一样。这在创意写作领域尤为明显,因为不同模型可能在不同风格维度上各有所长。此外,ELO系统的收敛速度依赖于对局数量,在AI评估场景中,新模型上线初期的排名波动可能很大,容易误导用户。
三是专家评审模式,由具备专业背景的评委按照多维度标准进行打分。每种方法都有其局限性——自动化指标无法捕捉创意的微妙之处,众包投票容易受到样本偏差和用户群体偏好的影响,而专家评审则面临成本高昂和评委间一致性低的问题。
这种主观性还进一步细分。有用户补充道,评估还取决于你在做哪种类型的创意写作——虚构故事创作与互联网内容创作之间存在巨大差异。一个模型可能擅长撰写引人入胜的短篇小说,却在生成社交媒体文案时表现平平,反之亦然。单一的"创意写作"分数,很难涵盖如此多元化的应用场景。学术界已有多项尝试建立更系统的创意写作评估框架,例如宾夕法尼亚大学研究团队提出的多维度评估方案涵盖连贯性、相关性、新颖性、风格等维度,斯坦福的HELM基准则尝试将模型评估扩展到数十个维度。但这些框架面临一个共同的元问题:维度权重如何确定?对于侦探小说,情节紧凑性可能最重要;对于意识流文学,语言实验性则更关键。这种"评估的评估"问题使得统一框架的建立异常困难。
"Claude味道":难以摆脱的AI写作烙印
讨论中一个反复出现的关键词是所谓的"Claude flavour"(Claude味道)。多位用户反映,无论如何调整提示词,Claude的输出总带有某种一眼可辨的固定风格和陈词滥调。
一位用户表示:"我试遍了网上能找到的所有自定义写作指令,它仍然使用那些让我瞬间出戏的相同短语和套路。"另一位用户也深有同感:"我就是无法从写作中去除'Claude味道',无论怎么做都不行,而中国的模型在写作风格上似乎开放得多。"
这个现象值得深思。它反映出不同厂商的模型在训练过程中形成了独特的"文风指纹"。现代大语言模型通常经历预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)三个阶段。大语言模型的写作风格不仅受微调阶段影响,预训练语料的构成同样起着决定性作用。例如,如果预训练数据中包含大量维基百科和学术论文,模型可能倾向于客观、说明性的语调;如果包含大量小说和诗歌,则可能展现出更丰富的修辞手法。不同模型厂商对预训练数据的筛选策略差异——包括数据去重方法、质量过滤标准、领域配比等——从根本上塑造了模型的"基础人格",这在后续微调中难以完全改变。
在RLHF阶段,人类标注员对模型输出进行偏好排序,训练出一个奖励模型(Reward Model),模型随后通过PPO等算法优化以获得更高的奖励分数。这个过程中,如果标注团队有统一的审美倾向——比如偏好优雅、细腻的表达——模型就会系统性地学习这种风格。用户所抱怨的"陈词滥调"和"套路化回复"在技术上与"模式崩塌"(Mode Collapse)现象相关。这一术语源自生成对抗网络(GAN)研究,指生成模型倾向于产生少数几种安全的输出模式而忽略输出空间的多样性。在大语言模型中,RLHF训练可能加剧这一问题:奖励模型一旦给予某些表达模式高分,模型就会反复使用这些模式,导致输出多样性降低。这也是为什么许多用户感到AI写作"千篇一律"的技术根源。
Claude之所以形成如此鲜明的"味道",很可能源于Anthropic在对齐训练中使用了具有高度一致性文学审美的标注团队,以及其Constitutional AI方法对输出风格的额外约束。Constitutional AI(宪法AI)是Anthropic开发的独特对齐技术,它不仅通过人类反馈训练模型,还让模型根据一组预设的"宪法原则"进行自我批评和修正。这些原则涵盖有益性、无害性和诚实性等维度。在写作风格层面,这种自我约束机制可能导致模型系统性地避免某些表达方式(如过于口语化、粗犷或实验性的风格),而趋向于一种经过"过滤"的、安全且优雅的中间态。这解释了为何用户感到Claude的写作"无论怎么调都像Claude"——风格约束已深深嵌入模型的决策过程中。
这种指纹对某些用户而言是优雅的标志,对另一些用户则是破坏沉浸感的顽疾。有趣的是,正是这种风格上的"倔强",让部分用户转向了在写作风格上更具可塑性的中国AI模型。讨论中多次提及的中国AI模型(如Kimi K3、DeepSeek PRO)在写作风格上的"开放性",有其深层的技术和文化原因。这些模型通常在中英双语大规模语料上进行预训练,跨语言训练可能赋予模型更灵活的表达能力和更少的单一风格锁定。此外,不同公司在RLHF阶段的对齐策略差异显著——相比Anthropic对安全性和一致性的高度重视,部分中国AI公司可能在微调阶段给予模型更大的风格自由度。
DeepSeek等采用混合专家架构(MoE)的模型,其不同专家子网络可能天然具备风格多样性的潜力。混合专家架构是一种稀疏激活的神经网络设计,模型包含多个"专家"子网络,每次推理时只激活其中一部分。DeepSeek-V2/V3等模型总参数量可达数千亿但每次推理仅使用其中一小部分,实现了效率与能力的平衡。理论上,不同专家子网络可能在训练过程中自发地"专攻"不同风格或领域——某些专家可能偏向简洁叙事,另一些可能擅长抒情描写,这种架构天然的分布式特性可能赋予模型在风格表达上更大的灵活性。值得一提的是,MoE架构中的路由机制(Router)决定了哪些专家被激活,不同的输入提示可能触发不同的专家组合,这为风格多样性提供了一种内建的机制——相比Dense模型(所有参数都参与每次计算)的"统一人格",MoE模型更像是一个"多重人格"的集合体。
关于Fable模型的评价分歧
原始排名中,Gemini 3.7 Flash被评为"略逊于Fable",但这一评价同样遭到质疑。有用户提出异议:"比Fable差?你确定?在我的体验里Fable在创意写作上很糟糕。它太过头了——辞藻堆砌、令人反感的感官描写等等。"
Fable是一家专注于叙事AI的初创公司推出的模型,其设计目标是生成高质量的故事性内容。用户所批评的"辞藻堆砌"和"令人反感的感官描写"在AI写作社区中有一个专门术语——"紫色散文"(Purple Prose),指过度华丽、堆砌形容词和比喻的写作风格。这一术语最早可追溯至古罗马诗人贺拉斯,他在《诗艺》中批评某些作家在作品中插入华丽但不相关的描写段落,称其为"紫色补丁"(purpureus pannus),暗示这些段落如同缝在朴素布料上的紫色绸缎般突兀。
这种现象在经过创意写作数据集微调的模型中尤为常见,因为训练数据中的高评分文本往往倾向于描写丰富的文学作品。这导致模型学会了"越华丽越好"的隐含规则,而忽视了简洁有力同样是优秀写作的标志。这是一种典型的Goodhart定律表现——当一个指标成为优化目标时,它就不再是好的指标。Goodhart定律由英国经济学家Charles Goodhart于1975年提出,原文表述为"任何被观察到的统计规律性在被施加控制目的压力后都趋于崩溃"。在AI训练中,这意味着当模型发现"描写丰富"与"高奖励分数"相关后,它会极端化地追求描写密度,远超人类标注员原本偏好的程度。模型优化了"华丽程度"这个代理指标,而非真正的叙事质量。海明威的冰山理论所强调的克制与留白,在当前AI写作评估框架中几乎得不到合理的度量。海明威主张好的写作应像冰山一样,只有八分之一露出水面——读者能感受到的力量来自未被明确写出的部分。这种"少即是多"的美学对AI模型来说极具挑战性,因为当前的训练范式鼓励模型生成更多内容而非更精炼的内容。
这一分歧再次强化了社区的核心观点:一个模型的"华丽辞藻"在某些评判者眼中是加分项,在另一些人看来却是矫揉造作的减分项。当评价标准本身如此对立时,任何排名都难免带有评判者的个人审美偏好。
什么样的AI写作基准测试才值得信任?
在一片质疑声中,也有用户提出了建设性的思考。有评论者认为,理想的创意写作基准应当采用盲评机制:"我只会信任那种由接受过文学相关高等教育的评委进行盲评的基准测试。"
这个建议触及了AI评估的方法论核心。盲评(Blind Evaluation)是学术研究中控制评估偏差的标准方法,在AI领域的应用日益受到重视。其核心原则是评估者在不知道输出来源的情况下进行判断,消除品牌效应和先入为主的偏见。在AI写作评估中,这意味着评委不知道哪段文字来自哪个模型。Chatbot Arena已经部分实现了这一点,但其评委池是普通网络用户而非文学专业人士。学术界有研究表明,专家评估与大众评估在创意任务上的相关性可能低于预期——一项针对短篇小说质量的研究发现,创意写作MFA(艺术硕士)学生与普通读者对同一组文本的排序仅有中等程度的相关性,这进一步增加了设计可靠基准的复杂性。这也引发了一个更根本的哲学问题:在创意写作领域,究竟谁有资格作为权威评判者?是受过系统训练的文学专家,还是代表最终消费者的普通读者?
当前许多创意写作榜单要么依赖自动化指标,要么依赖普通用户的主观投票,两者都难以真正衡量文学质量。理想的评估体系可能需要多层次设计:既有大规模的大众偏好数据,也有小规模但高质量的专家深度评审。此外,评估维度的细化也至关重要——将"创意写作"拆分为情节构建、角色塑造、对话自然度、风格一致性、意象运用等子维度分别评分,可能比单一总分更有参考价值。一些前沿研究还在探索"相对评估"而非"绝对评估"的方法论——不再试图给模型一个绝对分数,而是在特定任务、特定用户群体的语境下,提供条件性的推荐。引入具备专业素养的盲评人,或许是提升评估可信度的可行方向——尽管这会大幅增加评估成本和难度。
Gemini 3.7 Flash的真实写作表现
抛开排名争议,不少用户对Gemini 3.7 Flash本身持积极态度。一位曾经的Gemini PRO重度用户表示,尽管转向了中国模型,但仍打算充值OpenRouter测试Flash 3.7,并称在Google AI Studio中的初步体验"我挺喜欢的"。
OpenRouter是一个统一的AI模型API聚合平台,允许用户通过单一接口访问来自Google、Anthropic、OpenAI、Meta等多家厂商的数十个模型。用户按token使用量付费,无需为每个模型单独订阅。这类平台的兴起反映了AI应用层的一个重要趋势:模型正在走向商品化(Commoditization),用户不再被锁定在单一生态系统中,而是可以根据具体任务灵活切换模型。就像云计算领域的多云策略一样,用户希望避免供应商锁定(Vendor Lock-in),这对模型提供商意味着竞争从单一的"谁更聪明"转向更复杂的维度:推理速度、上下文窗口长度、微调灵活性、价格,以及——正如本文讨论所揭示的——写作风格的适配性。Google AI Studio则是Google提供的免费模型实验平台,开发者可以在其中测试Gemini系列模型的各种能力,包括多模态输入、长上下文处理和结构化输出等。
另有用户虽然抱怨"我唯一讨厌Gemini的就是它那些陈词滥调的回复",但同时承认"除此之外它真的很不错"。还有用户在提及某个特定能力维度时评价:"在那个方面,进步是实实在在的。"
这些评价勾勒出一个相对平衡的画面:Gemini 3.7 Flash并非完美,其套路化表达仍是短板,但在整体创意写作能力上确有实质性进步。值得注意的是,Gemini系列模型的"Flash"后缀代表其定位为轻量化、低延迟的版本,相比完整的PRO版本在参数规模上有所精简但推理速度更快、成本更低。Flash模型在创意写作上能取得如此评价,意味着Google在模型蒸馏和效率优化方面取得了显著进展——以更小的模型逼近更大模型的创意能力。Google的Flash模型很可能采用了知识蒸馏(Knowledge Distillation)技术,即让较小的"学生模型"学习较大"教师模型"的行为分布,而非直接从原始数据学习。这一技术由Geoffrey Hinton等人在2015年提出,核心思想是教师模型输出的概率分布(软标签)包含了类别间关系的丰富信息——例如,一个词被预测为"璀璨"的概率为0.6、"闪耀"为0.3、"明亮"为0.08,这些比例关系本身就编码了语义近似度信息。在创意写作场景中,蒸馏可能保留了大模型对语言细微差别的感知力,同时大幅降低了推理成本。Google还可能结合了在线蒸馏、自蒸馏和渐进式蒸馏等进阶技术来进一步优化Flash模型在创意任务上的表现。
结语:排名之外的思考
这场围绕Gemini 3.7 Flash排名的讨论,其价值远超排名本身。它提醒我们,在AI能力日益强大的今天,并非所有能力都能被简单量化。创意写作作为一项高度依赖个人审美、文化背景和使用场景的任务,任何单一的排名都应当被审慎看待。
从更宏观的视角来看,这场争论折射出AI发展的一个深刻张力:工程思维倾向于将一切量化、排序、优化,而创意本质上抵抗这种简化。当我们试图用单一数字衡量一个模型的"创意写作能力"时,我们实际上是在将一个多维度、高度情境依赖的能力压缩到一维标量上——信息损失是不可避免的。这与物理学中的降维问题有着深层的类比:正如将三维物体投影到二维平面必然丢失深度信息,将多维度的创意能力压缩为单一排名分数也必然丢失关键的差异化信息。未来,AI创意写作评估或许需要从"谁是第一"的排名思维,转向"在什么场景下、对什么类型的用户、哪个模型最合适"的匹配思维。这种个性化推荐范式已在其他领域(如音乐推荐、电影推荐)取得成功,将其应用于AI模型选择或许是值得探索的方向。
对于普通用户而言,最实用的建议或许是:不要迷信榜单,用自己的真实需求去测试候选模型。毕竟,能写出让你满意文字的模型,才是你的"最佳模型"。
相关推荐

Claude自主设计蛋白质成功率35%,远超人类专家水平
Anthropic的Claude模型在自主设计靶向疾病蛋白质任务中取得35%实验成功率,远超人类专家10%-15%的平均水平。本文深入解析这一湿实验验证成果对生物医药行业的潜在影响。

Perplexity Discover多语言支持突然消失,国际用户为何不满?
Perplexity Discover新闻资讯功能突然取消多语言支持,仅保留英文内容,引发国际用户强烈不满。本文分析功能回退的可能原因,探讨AI产品国际化面临的资源权衡与用户信任挑战。
