Unverified50% confidenceFactExact time
国产大模型预训练语料中中文数据占比通常达到30%-50%,而海外模型中文语料占比往往不足10%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
GPT、Claude、Gemini与国产三强横评:代码能力、中文表现与价格全对比
bilibiliai先行者老胡6/21/2026
Related Claims
UnverifiedModeration模型训练数据以英语为主,对中文内容的识别准确率相对较低78% similarUnverified中文转写准确率标称值需按场景打折:安静环境标称95%以上机型,实际多人交叉说话/带口音时会掉到70-80%,方言支持是硬门槛,购买前确认是否支持粤语/四川话等目标方言73% similarUnverified同样的中文文本在不同大模型服务商处消耗的 Token 数量可能相差 30%-50%71% similarUnverified中文版本虽已本土化,但中国本土常模的样本量和行业覆盖度不如英语市场成熟,对于部分细分行业或基层岗位的常模参照精度可能不足;采购前应确认供应商能否提供匹配目标岗位层级的参照常模71% similarUnverified中文场景下通常需要选择专门针对中文语料训练的Embedding模型,以保证语义表达的准确性和检索质量70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/43192API
curl https://kongchang.com/api/v1/knowledge/claims/43192MCP
get_claim(id=43192)