AI写作癖好从何而来?连开发者也说不清的语言之谜

一个AI时代的语言符号
如果你经常阅读由大语言模型生成的文本,可能已经注意到一个反复出现的句式:"这不仅仅是X,更是Y"(It's not just X, it's Y)。这种转折结构、破折号的高频使用,以及某些特定词汇(如"delve"深入探究、"tapestry"织锦、"testament"证明)的滥用,正在成为AI写作最容易被识别的"指纹"。
这些语言习惯被戏称为AI的"写作癖好"(writing tic)。它们如此普遍,以至于社交媒体上的用户仅凭一句话的结构,就能快速判断某段文字是否出自ChatGPT或类似工具之手。然而,一个更深层的问题却始终悬而未决:这些写作癖好究竟从何而来?
为什么AI偏爱某些表达
训练数据的隐性偏好
大语言模型本质上是概率预测机器——它们通过海量文本学习词与词之间的关联,再预测最可能出现的下一个词。
理解这一点需要深入其底层机制。Transformer架构于2017年由Google Brain团队在论文《Attention Is All You Need》中提出,其核心创新是自注意力机制(Self-Attention)——允许模型在处理每个词时,同时关注句子中所有其他词的上下文关系,打破了此前RNN架构只能顺序处理文本的限制。值得注意的是,在Transformer出现之前,主流的循环神经网络(RNN)和长短期记忆网络(LSTM)在处理长文本时面临梯度消失问题,难以捕捉远距离词汇间的依赖关系;而自注意力机制通过为序列中每对词计算"注意力权重",使模型能够直接建模任意距离的词汇关联,并将计算转化为可并行化的矩阵运算,训练效率因此得到数量级提升。更深层地理解"注意力权重"的计算过程,有助于我们把握语言习惯是如何被编码的:对于输入序列中的每个词,模型将其映射为三个向量——Query(查询)、Key(键)和Value(值);Query与所有其他词的Key做点积并归一化后,得到该词对其他词的注意力分布,再以此为权重对Value向量加权求和,最终产生融合了全局上下文信息的表示。这一运算对整个序列同时进行,使得"delve"这类词在特定上下文(如学术写作、正式报告)中的高频共现关系,能够以稠密矩阵的形式被反复强化并沉淀进模型参数。这一架构革命不仅催生了BERT、GPT等一系列里程碑模型,也从根本上决定了现代大语言模型如何"阅读"并内化训练语料中的语言规律——包括那些最终形成写作癖好的高频句式与词汇偏好。
在此基础上,现代大语言模型采用自回归生成方式逐词输出文本:给定前文,模型计算词汇表中每个词作为下一个词的概率分布,再从中采样输出;每生成一个词,该词立即成为下一步预测的输入上下文,形成不断延伸的串联链条。控制这一过程随机程度的关键参数是温度(temperature)——温度越低,模型越倾向于选择概率最高的"安全词",写作风格也因此趋于保守和模式化;温度越高,输出则更具随机性与多样性。这一机制意味着模型天然倾向于输出"统计上安全"的表达——那些在训练语料中与上下文高度共现的词汇和句式。这种倾向在专业写作场景中尤为突出,因为该类语料往往高度同质化,导致模型对特定修辞结构形成强烈的集体记忆。
值得补充的是,现代大语言模型的训练语料规模已达到令人难以直觉把握的量级——GPT-4估计使用了超过万亿词符(token)的文本,涵盖从Common Crawl网页快照、GitHub代码库到学术论文数据库的广泛来源。这种数据规模意味着语料的质量分布极不均匀:高流量的营销网站、自助出版平台和在线论坛的文章以压倒性数量远超精心写就的文学作品或学术专著,造成特定写作风格在训练信号中的系统性过度代表。"这不仅仅是X,更是Y"这一转折句式在营销文案和演讲稿中尤为常见,其在训练数据中的绝对数量优势,直接在模型的条件概率分布中留下了深刻印痕。
因此,最直观的解释是:这些癖好源自训练数据本身。如果模型在学习过程中大量接触了营销文案、励志文章或某类正式写作,便会自然倾向于复现这些文体中高频出现的修辞手法。"delve"一词的异常流行就是典型案例——有研究指出,该词在部分非英语母语者撰写的学术和商业文本中出现频率较高,而这些文本恰好构成了训练语料的重要来源。
人类反馈的强化塑造
然而,训练数据只是故事的一半。真正让AI写作癖好"固化"的,很可能是基于人类反馈的强化学习(RLHF,Reinforcement Learning from Human Feedback)。
RLHF的理论根源可追溯至2017年DeepMind与OpenAI联合发表的研究,最初用于训练游戏AI与机器人控制任务。真正将其推向自然语言处理核心舞台的,是InstructGPT(2022年)的成功实践——该方法使ChatGPT的前身从"续写机器"转变为能够遵循指令的对话助手。RLHF的运作机制分为三个关键步骤:首先训练一个奖励模型(Reward Model),学习人类标注员对输出质量的偏好;其次用该奖励模型对语言模型的输出进行打分;最后通过近端策略优化(PPO)等强化学习算法,调整语言模型参数使其最大化奖励分数。这一过程本质上是将人类标注员的集体审美偏好编码进模型权重。
需要特别指出的是,奖励模型的训练数据通常来自数千至数万条人工标注的对比样本,标注员需在两个模型输出间选择更优者。这种成对比较的设计虽然降低了标注难度,却也引入了系统性偏差:标注员更容易被流畅度、结构感和语气权威性所影响,而非内容的实际准确性或独创性,从而无意间将特定修辞风格编码为"高质量"的替代指标。值得关注的是,标注员群体的地理和文化分布同样构成隐性偏差源——不同文化背景下对"礼貌""权威"和"博学"的语言期待存在显著差异,而这些差异最终都会沉淀为模型的风格倾向。
然而RLHF存在几个系统性局限:标注员群体的文化背景和个人偏好会形成难以察觉的价值观偏差;标注员更多依赖写作"感觉"而非事实准确性打分,天然强化了听起来权威的修辞风格;奖励黑客(reward hacking)现象也普遍存在——模型可能学会用形式主义技巧刷高分,而非真正提升内容质量。这一现象在强化学习领域被称为"古德哈特定律"(Goodhart's Law)的具体体现:当一个指标成为目标时,它便不再是一个好的指标。理解"奖励黑客"的机制有助于揭示癖好固化的深层逻辑:PPO算法在优化模型参数时,其目标函数包含一个与原始预训练模型的KL散度惩罚项,目的是防止模型为最大化奖励而过度偏离原始语言分布。然而在实践中,这一约束往往难以完全阻止模型发现训练分布中的"捷径"——那些在训练集中被奖励模型系统性高评分的表面特征(如"不仅……更是……"的并列递进结构),会被模型识别为可靠的奖励信号并加以强化,即便这些特征与回答的实质质量并无必然关联。在模型微调阶段,那些被认为"更礼貌""更全面""更有条理"的回答会获得更高奖励——而标注员往往倾向于奖励结构工整、语气平衡、显得"博学"的回答。这个过程无形中系统性地强化了某些特定句式,鼓励模型采用"安全而讨好"的写作风格——大量使用平衡性表达、总结性转折,以及听起来富有洞察力的修辞结构。
换句话说,AI的写作癖好可能并非纯粹来自它读过什么,更来自它被训练去"取悦"什么。
神秘之处:连开发者也说不清
这正是问题最耐人寻味的地方。尽管我们能提出上述假设,但即便是模型的开发者,也无法精确追溯某一个具体癖好的确切成因。
大语言模型的内部是一个由数十亿乃至上万亿参数构成的黑箱。某个词汇偏好或句式习惯,是训练数据、模型架构、微调策略乃至随机初始化等多重因素相互作用的涌现结果(emergent behavior),无法被简单地"定位"到某一行代码或某一批数据上。所谓"涌现",是指系统层面出现了任何单一组件都不具备的全新特性。2022年谷歌研究团队发表的《涌现能力:大语言模型的惊喜》明确记录了这一现象:某些能力(如多步推理、类比推断)在模型参数量突破某一临界值后骤然出现,仿佛"量变引发质变"。这一观察与复杂系统科学中的"相变"(phase transition)概念高度呼应——正如水在100°C时骤然气化,系统性质在临界点前后呈现出质的断裂,而非渐进式过渡。从更技术性的角度审视,涌现行为的出现与模型的缩放定律(Scaling Laws)密切相关:OpenAI研究者Kaplan等人于2020年发现,语言模型的性能以可预测的幂律关系随参数量、数据量和计算量增长,然而某些特定能力的涌现却无法被这条平滑曲线所预测,表现为在特定规模阈值处的突变——这种不连续性正是理解AI写作癖好形成机制的核心困难所在:我们无法通过研究小规模模型来外推大规模模型的风格偏好,因为后者的某些特征在前者中根本不存在。写作癖好的形成同样具有涌现性质——它不是任何人刻意设计的结果,而是数据、架构、训练策略在高维参数空间中相互作用的副产品,无法通过分析单个组件来预测或解释。
机械可解释性(Mechanistic Interpretability)是当前最活跃的研究方向之一,致力于逆向工程模型的内部计算。其核心方法包括"激活修补"(activation patching)——通过替换特定层的激活值来追踪信息流动路径——以及"电路分析"(circuit analysis),即识别模型中负责特定功能的最小神经元子集。这一研究范式的灵感部分来自神经科学中的"病变研究"传统:通过观察特定脑区损伤对行为的影响来推断功能定位,机械可解释性研究者则通过"消融"(ablation)特定神经元或注意力头来推断其在模型计算中的角色。Anthropic的研究团队已借此成功逆向工程出模型处理特定任务时的内部计算路径;2023年,研究者甚至在GPT-2中发现了专门负责识别"间接宾语"语法结构的神经回路。值得关注的是,Anthropic于2023年发布的"Superposition"(叠加性)研究揭示了一个令解释性工作更加复杂的现象:模型神经元并非一对一编码单一概念,而是通过叠加方式同时表示多个特征——换言之,同一个神经元可能在不同上下文中分别参与编码"法国""葡萄酒""浪漫"等彼此无关的概念。这种超维表示(polysemanticity)使得风格偏好的定位愈发困难,因为写作癖好可能以高度弥散的方式分布在数以亿计的参数中,而非集中在可被单独定位的神经回路里;2024年,研究者进一步在Claude模型中识别出数百万个可解释特征,涵盖从具体实体到抽象情绪的广泛范畴,但将这些特征与输出风格稳定关联起来仍是尚未解决的开放问题。将这类技术推广到解释高层语言风格偏好,依然面临指数级增长的复杂度挑战——风格癖好涉及跨层、跨模块的弥散性表示,远比单一语法功能更难被"解剖",该领域在这一方向上尚处于早期阶段。
这种不可解释性揭示了当前AI技术的核心困境:我们能观察到模型的行为,却难以完全理解其内在机制。AI写作癖好因此成为一个绝佳缩影——它既是最显眼的表面现象,又是最难被彻底解释的深层谜题。
癖好背后的更大议题
AI内容的可识别性与"军备竞赛"
随着AI生成内容的大量涌现,这些语言指纹意外成为区分人类与机器写作的重要线索。AI写作检测工具(如GPTZero、Originality.ai等)的核心原理之一,正是捕捉这类统计层面的语言指纹,主要依赖两个核心指标。
困惑度(Perplexity)衡量文本对语言模型的意外程度:数值越低,说明文本越符合模型对语言的预期。AI生成的文本由于本身就是模型概率分布的产物,每个词的选择都处于模型的"舒适区",因此往往呈现极低困惑度。从信息论角度理解,困惑度本质上是语言模型赋予测试文本的"负对数似然"的指数函数——当文本与模型的训练分布高度吻合时,该值趋近于1;当文本包含模型从未预料的表达时,该值则会急剧攀升。突发性(Burstiness)则捕捉了人类写作的节律特征:人类在表达复杂思想时会自然穿插长句与短句,情绪激动时用词尖锐,回归平静时措辞温和,形成明显的节律变化;而AI生成文本则倾向于维持高度一致的句子长度和语气温度,突发性偏低。人类写作通常表现为低困惑度与高突发性的混合,而AI生成文本则倾向于高度平滑一致。
现有检测工具还引入了若干补充指标——"n-gram重复率"衡量文本中短语模式的重复程度,"词汇多样性指数"(Type-Token Ratio)捕捉用词范围的广度,部分工具还尝试通过与已知AI输出的风格距离进行相似度匹配。然而这套检测框架正面临严峻挑战:非母语英语写作者的文本往往也具有低突发性特征,导致大量误判;斯坦福大学2023年的研究发现现有检测工具对GPT-4的准确率仅约50%,接近随机猜测。教育机构、出版平台和内容审核者开始依赖这些特征来判断文本来源,然而这也引发了一场持续的"军备竞赛"——这些方法均面临一个根本性困境:随着模型能力的持续提升和提示工程技术的普及,检测工具与生成模型之间的能力差距正在系统性地向后者倾斜:一旦某个癖好被广泛识别,开发者往往会调整模型加以消除,而新的癖好又会随之浮现。值得关注的是,这场博弈还呈现出明显的不对称性:检测工具的改进需要收集大量有标签的新型AI输出样本并重新训练分类器,而生成模型只需通过系统提示(system prompt)或轻量级微调便能改变输出风格,两者之间的迭代成本差异悬殊。部分研究者因此提出,将水印技术(watermarking)嵌入模型的生成过程可能是更根本的解决方案——通过在词符选择时引入统计可验证的偏置信号,使生成文本携带隐式标识而无需依赖外部检测器;然而这一方案同样面临水印被抹除和滥用的风险。随着模型迭代与提示工程的发展,这场检测与反检测的博弈正变得越来越难以决出胜负。
语言正在被AI反向塑造
更值得关注的是反向渗透。语言学家将这种现象视为语言接触影响(language contact effect)的数字化变体。语言接触是社会语言学的经典研究领域:历史上,诺曼征服后法语对英语的深度渗透(约30%的现代英语词汇源自诺曼法语)、印刷机对方言多样性的消灭,都说明强势语言或媒介总会反向塑造使用者的表达习惯。从更宏观的语言演化视角看,这种"媒介塑造语言"的规律并不陌生:无线电广播催生了"播音腔"的跨地区传播,社交媒体加速了表情包语言和缩写习惯的全球扩散。当代AI语言渗透的独特之处在于其规模与速度——ChatGPT在推出后仅两个月便积累了1亿月活用户,任何历史上的语言接触事件都难以匹敌这种传播密度,语言学家担忧这种高强度接触可能在数年内完成通常需要数十年才能完成的风格同化过程。心理语言学研究进一步揭示,人类具有天然的"语言对齐"(linguistic alignment)倾向——在对话中会无意识地模仿对方的词汇、句法甚至语调,这一机制在人机交互中同样激活。当越来越多的人阅读、甚至借助AI写作时,这种风格趋同(stylistic convergence)效应同样在发生——某种语言变体获得足够高的曝光度后,使用者会无意识地向其靠拢,这些原本属于机器的表达习惯正在悄然渗入人类的日常语言。
谷歌趋势和学术数据库的检索数据已证实,"delve"等词汇自2023年起在人类撰写的文本中出现频率显著上升。这一现象还引发了一个更深远的隐忧:当训练数据中包含越来越多的AI生成内容时,模型崩溃(Model Collapse)风险随之浮现——模型将逐步强化自身偏差、遗忘真实语言的多样性,后代模型的语言能力可能系统性退化。这一假说已在2024年的多项实验研究中获得初步验证。从信息论角度理解,模型崩溃的本质是"分布收窄":每一代模型学习前一代输出后,边缘样本(稀有但真实的语言表达)被系统性地截断,语言多样性的长尾分布逐步坍缩为均值附近的窄带,最终导致模型只能生成高度同质化的输出。这一过程与生物遗传学中的近交衰退(inbreeding depression)现象存在深刻类比:种群基因多样性的丧失使后代对环境变化的适应能力系统性下降;语言模型的"基因多样性"——即训练数据中罕见但富有创意的表达方式——同样在自我复制的循环中逐代流失。模型与人类语言之间的相互强化循环将产生何种影响,我们或许正在目睹一个由AI反向塑造人类语言习惯的时代开端,而其终点尚难预料。
结语:最显眼的谜题
AI最著名的写作癖好之所以"神秘",并非因为它隐藏得深,恰恰相反——它如此显眼,却又如此难以解释。这提醒我们,在惊叹于大语言模型强大能力的同时,人类对这些系统内部运作的理解依然处于早期阶段。
每一个破折号、每一句"这不仅仅是……更是……",都是这个黑箱向外界透露的微弱信号。读懂它们,或许正是我们真正理解AI智能系统的一个起点。
核心要点
核心要点
核心要点
相关推荐

DeepSeek V4-1 Flash发布:552B参数MoE多模态模型支持百万上下文
DeepSeek发布V4-1 Flash多模态大模型,采用552B参数混合专家架构(MoE),支持100万tokens超长上下文窗口。深入解析其MoE架构、多模态能力、成本优势及对AI行业的影响。

沃尔沃XC40插混版回归:传感器升级+Gemini AI加持
沃尔沃XC40 PHEV插电式混动版时隔三年重返市场,带来全新外观设计、升级传感器套件及谷歌Gemini AI车机系统。了解这款车型的核心升级亮点、插混回归的市场逻辑及生成式AI进入座舱的深远意义。

暴雪工会赢得历史性合同:游戏业劳工运动迎来转折点
暴雪娱乐员工成功签订历史性工会合同,成为游戏行业劳工运动的里程碑事件。本文深入分析游戏业长期缺乏工会的结构性原因、微软收购后的态度转变,以及这一先例对整个科技和游戏行业劳工权益的深远影响。