AI写小说哪个模型强?五大模型剧情推演实测对比

横向实测五大AI模型写爽文,智谱GLM剧情逻辑最稳,Claude和Gemini成文质感更佳。
一位B站UP主用统一的爽文设定对DeepSeek、智谱GLM、千问Qwen、Gemini和Claude做了剧情推演横向测评,重点考察反转设计、AI味浓淡和指令遵从度。结果显示,智谱GLM(5.3)的破局逻辑最符合爽文因果链条,AI互评获89分居首;DeepSeek因"自掏腰包请客"等逻辑雷点被扣分;千问被判写崩;Claude出现凭空设定、低于预期;Gemini疑似因引导不足而发挥失常。测评者最终建议:做剧情大纲推演首选GLM,追求文字质感和严谨度则首选Claude或Gemini。但测试者也强调,这只是单期主观实测,模型版本和提示词写法会显著影响结论。
AI写小说这两年成了热门玩法,但面对DeepSeek、GLM(智谱)、Qwen(千问)、Gemini、Claude这么多主流模型,创作者往往拿不准到底谁更擅长剧情构思。一位B站UP主用同一套设定(同样的故事开篇、技能、全序设定)对多个模型做了横向测试,重点考察它们在小说剧情推演上的表现。本文梳理这场实测的结论,供有AI创作需求的读者参考。
测试方法:同题竞技,聚焦剧情推演
本次测试采用统一变量:相同的故事开端、相同的主角技能设定、相同的世界观全序设定,让各模型独立完成第一单元的故事大纲与剧情推演,再从三个维度打分——AI味浓淡、剧情设计(尤其反转与阻力)、指令遵从度。
参与测试的模型包括DeepSeek、智谱GLM、千问Qwen、Gemini(Flash版本)以及Claude(使用的是Sonnet 4.5,非最新版本)。测试者特别说明,Claude受限于无法拿到最新版本,可能影响了它的实际发挥。
值得一提的是,这类测试属于单一UP主的主观评测,评分带有个人审美倾向,读者应把结论当作参考而非定论。
爽文是网络文学中的一个重要类型,核心特征是主角凭借外挂能力(系统奖励、技能加持等)不断碾压反派、积累资源、实现逆袭,情节节奏快、爽感强,逻辑上要求主角行事符合"利益最大化"原则。正因如此,"自掏腰包请客"这类主动损耗资源的行为会被读者本能地视为违和——它打破了爽文的基本契约。测试者以此作为核心评判标准之一,本质上是在考察模型是否真正理解了这一类型的写作规则,而非泛用的"故事合理性"。
全序设定指的是在提示词中提前交代完整的世界观、规则体系和人物背景,相当于给模型一份详细的创作圣经。这种做法能减少模型自由发挥带来的偏差,但同时也是一块"试金石"——模型是否会无视、遗忘或擅自修改这些设定,直接反映其指令遵从能力。Claude出现"凭空设定"正是在这一维度上失分。
各模型表现逐一拆解
DeepSeek:开篇大纲规划能力尚可,测试者给到约85分,但暴露了明显的创作痕迹——生成时把"AI修设库、储材库"这类内部结构直接写了出来,露了马脚。更关键的问题在反转设计上:主角用系统刚奖励的十万块钱请全组吃宵夜来破局,这被测试者直指为"雷点"。

"爽文的主角怎么会用自己的钱去做这种事?"测试者认为,主角并未设定为富有,系统刚给十万就拿去请客,完全不符合爽文逻辑;同时靠威胁"给我其他艺人的黑料"来破局也站不住脚,威胁力度不够。这些逻辑漏洞成了DeepSeek的主要扣分项。

智谱GLM(字谱5.3):测试者印象中GLM以前写得不错,但这次大纲的AI味在细节层面较小,宏观规划的AI味却偏高,指令遵从度中高,打分同样在85分左右,"和DeepSeek没什么区别"。不过在反转与主线设计上,GLM的表现反而成了本场亮点。

千问Qwen:评价最低。测试者认为它"太文青",反转剧情设计不佳,被直接判定"写崩了",多次强调"千问不行"。
Gemini(3.8 Flash):AI味中高,有想法但没设计好,指令遵从中高,打分80-85分。测试者主观判断Gemini的实际水平不该这么差,怀疑是沟通与推演引导不到位,倾向于重新沟通后再评估。
Claude(Sonnet 4.5):AI味最少、修改地方最少,本是测试者最期待严谨度的模型,但这次的阻力设计出现了"打卡收益被分流"这种原设定里根本不存在的内容,属于"轻度雷点",最终80分,表现不及预期。

反转设计的关键差异
这场测试真正拉开差距的,是各模型对剧情反转与阻力设计的处理。
测试者对比后认为,GLM(智谱5.3)的反转设计最符合逻辑:第一关是应聘现场、第二关是网络舆论、第三关栽赃后让双方"狗咬狗",这套破局思路虽然质朴,但符合爽文的因果链条。相比之下,DeepSeek的"自掏腰包请客"、Claude的"凭空设定"、千问的"过度文青"都在这一环节掉了链子。
换句话说,剧情推演比拼的不是辞藻华丽,而是动机是否合理、破局手段是否符合角色处境。GLM之所以胜出,正是因为它的方案"质朴但站得住脚"。
让Gemini当裁判:AI互评结果
测试者还请Gemini(3.8 Flash)从多维度对各模型输出做了一次AI互评,结果与人工感知大致吻合:
- GLM(智谱5.3):89分,最符合爽文逻辑,得分最高;
- DeepSeek:87分,时高时低、发挥不稳定,且存在逻辑雷点;
- 千问:不适合,写崩;
- Gemini与Claude本次均未进入第一梯队。
测试者对DeepSeek的87分持保留意见,认为它主线设计的逻辑硬伤不该拿到这个分数,但认同GLM的89分"跟我的感知差不多"。
用AI模型评价其他AI模型的输出,是近年来提示词工程实践中一种常见的辅助手段,有时被称为"LLM-as-Judge"(大模型作为裁判)。这种方法的优点是可以快速生成结构化的多维度评分,且与人类评审的感知往往存在一定相关性;但其局限同样明显:模型倾向于给措辞流畅、格式规整的输出打高分,而对逻辑硬伤的识别能力参差不齐,有时还会因训练数据重叠而对同厂模型产生评分偏差。本次测试者对DeepSeek 87分持保留意见,恰好印证了这一局限——AI裁判未能充分惩罚逻辑雷点,而人工审阅对此更为敏感。
结论:写文首推谁?
综合人工评测与AI互评,这场测试的最终倾向是:
- 剧情推演(大纲、反转逻辑):GLM(智谱5.3)表现最稳,最符合爽文逻辑,是本场最大赢家;
- 实际成文(文字质感、严谨度、低AI味):测试者仍倾向Claude和Gemini,认为Claude的严谨度和细节把控本应最强,只是这次状态不佳,Gemini则需要更好的沟通引导来释放水平。
测试者的综合建议是:做剧情推演首推GLM,写成文首推Gemini/Claude。需要提醒的是,这只是单期实测的结论,模型版本、提示词写法、题材类型都会显著影响结果——尤其Claude用的并非最新版,Gemini也可能因引导不足而低估。想找到最适合自己的AI写作搭档,还是得结合自己的题材多做几轮对比。
相关推荐

Cursor Pro低价共享账号避坑指南:那些续杯工具的真相
Cursor Pro低价共享账号、续杯插件、破解版究竟有哪些坑?本文解析降智、掉线、封号、额度清零等常见风险,帮你理性看待第三方Cursor增效服务与按量计费模式。

GPT-6 Astra解析:从回答问题到自主完成任务的转变
GPT-6 Astra是OpenAI推出的新旗舰模型,主打从回答问题到自主完成任务的转变。本文解析它的核心能力、擅长领域、基准成绩及走向AI智能体的意义。

吴恩达新课详解:用规范驱动开发驾驭编程智能体
吴恩达联合 JetBrains 推出规范驱动开发(Spec-Driven Development)新课,讲解如何用 Markdown 规范驾驭编程智能体。本文梳理三大收益、宪法与特性开发循环工作流,帮助新手高效构建可维护应用。