大模型乌尔都语测试翻车:GPT等顶尖LLM的多语言能力有多少水分

顶尖大模型在乌尔都语故事生成上频现语法、语义与文化错误,且少样本提示无法弥补文化层面的根本缺陷。
一项针对乌尔都语的实证研究系统检验了GPT-5.1、Qwen-3-Max、DeepSeek-3.1三款顶尖大模型在开放式文本生成任务中的真实表现。研究构建了包含93篇AI生成故事的Urdu-Stories语料库,并通过人工标注建立了涵盖语言、语义、文化三大维度的九类错误分类体系。结果显示,这些模型在乌尔都语上频繁出现基础语法错误、篇章连贯性崩塌和不自然重复,更存在普遍的"文化浅薄"问题——即便语法勉强过关,内容也缺乏对乌尔都文化背景的真实理解。关键发现在于,few-shot提示工程虽有局部改善,但文化与语境错误依然无法解决,揭示这是预训练数据层面的结构性缺陷,而非提示技巧所能弥补。研究警示业界:宣称支持"上百种语言"的多语言标签背后存在严重水分,AI语言能力的公平性问题亟需从数据建设和评估基准层面系统应对。
多语言大模型的"低资源"盲区
当前主流的大语言模型(LLM)几乎都以"多语言"作为卖点,宣称能够处理数十甚至上百种语言。然而,这种多语言能力在低资源语言(low-resource languages)上究竟有多可靠,一直缺乏系统性的实证研究。一篇发表于 arXiv 的新研究(arXiv:2609.10758)正是瞄准了这一盲区,选取乌尔都语(Urdu)作为代表性低资源语言,深入检验了当代 LLM 在开放式文本生成任务中的真实表现。
研究的核心问题很直接:当我们让这些模型用乌尔都语讲故事时,它们生成的内容到底有多正确、多可靠?答案并不乐观。
研究方法:三大顶尖模型与九类错误标注体系
为了给出可量化的评估,研究团队构建了一个名为 Urdu-Stories 的语料库,包含 93 篇由三款当代顶尖大模型生成的乌尔都语故事。这三款模型分别是:
- GPT-5.1(OpenAI)
- Qwen-3-Max(阿里巴巴通义千问)
- DeepSeek-3.1(深度求索)
这三款模型涵盖了英美与中国的顶尖闭源/开源体系,具有相当的代表性。研究者随后对这些故事中的错误进行了人工标注,并建立了一个包含九个标签的分类体系(taxonomy),横跨三个核心维度。
三大评估维度详解
- 语言层面(Linguistic):语法、拼写、词法等基础语言正确性
- 语义层面(Semantic):连贯性、逻辑性、表达自然度
- 文化层面(Cultural):对乌尔都语背后文化语境、习俗、社会背景的理解深度
这种分层标注的意义在于,它不仅告诉我们模型"错了",还能精确定位模型"错在哪个层次"——这对于诊断多语言模型的深层缺陷至关重要。
核心发现:从语法到文化的全面缺陷
研究结果揭示了一系列令人警醒的问题。在最基础的层面上,这些被誉为"最强"的大模型在乌尔都语上竟然频繁出现基础的语法与语义错误。这与它们在英语等高资源语言上近乎无懈可击的表现形成了鲜明对比。
连贯性崩塌与异常重复
研究指出,生成的故事普遍缺乏连贯性(coherence),并且存在不自然的重复(unnatural repetition)。这种重复问题是模型在目标语言训练数据不足时的典型症状——当模型对语言的概率分布掌握不够充分时,容易陷入局部循环,反复生成相似的句式或词组。
无处不在的"文化浅薄"问题
最值得关注的发现是普遍存在的文化浅薄(pervasive cultural shallowness)。模型即便在语法上勉强过关,其生成的故事也往往缺乏对乌尔都语使用者真实文化背景、价值观念、生活习俗的深入理解。故事读起来更像是"翻译腔"的产物,而非扎根于本土文化的原生叙事。
Few-shot 提示工程也无法拯救文化缺陷
一个自然的疑问是:如果通过提示工程给模型提供一些示例,能否改善这些问题?研究团队专门测试了 few-shot prompting(少样本提示) 的效果。
结果显示,few-shot 提示虽然在某些方面有所帮助,但文化错误和语境错误在很大程度上仍然无法解决。这一发现的启示意义重大:文化理解的缺陷并非简单的"提示不够好",而是根植于模型预训练阶段对该语言及其文化语料的严重不足。换句话说,这是一个数据和训练层面的结构性问题,无法仅靠推理阶段的技巧来弥补。
对AI行业的深层启示
这项研究对整个 AI 行业敲响了警钟。当各大厂商竞相宣传其模型支持"上百种语言"时,我们必须警惕这种"多语言"标签背后的水分。
语言"广度"不等于理解"深度"
支持一门语言的输入输出能力,与真正掌握这门语言及其文化,是两个截然不同的概念。对于英语、中文等高资源语言,海量的训练数据保证了模型的深度;但对于全球数千种低资源语言而言,模型可能只是学到了皮毛。乌尔都语作为拥有超过两亿使用者的主要语言尚且如此,那些使用人数更少、数字化语料更匮乏的语言处境可想而知。
内容生成与信息检索的可靠性风险
研究者明确指出,这些发现凸显了当前 LLM 作为低资源语言内容生成和信息检索可靠来源的局限性。如果用户依赖这些模型获取以低资源语言呈现的信息,他们可能面临语法错误、逻辑混乱乃至文化误导的风险。这对于教育、新闻、公共服务等应用场景尤其危险。
迈向真正公平的多语言AI
这项针对乌尔都语的研究,本质上是对 AI 语言公平性(linguistic fairness)的一次深刻拷问。技术的进步不应只惠及说主流语言的少数群体,真正的多语言 AI 应当在语言正确性和文化深度上对所有语言一视同仁。
要实现这一目标,行业需要在以下方向持续投入:
- 低资源语言的高质量语料建设
- 本土文化知识的系统性注入
- 面向文化维度的评估基准开发
在此之前,我们对大模型"多语言"能力的宣传,或许都应保持一份清醒的审慎。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。