待验证50% 置信事实精确时间
国产大模型预训练语料中中文数据占比通常达到30%-50%,而海外模型中文语料占比往往不足10%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
GPT、Claude、Gemini与国产三强横评:代码能力、中文表现与价格全对比
bilibiliai先行者老胡2026/6/21
相关事实
待验证Moderation模型训练数据以英语为主,对中文内容的识别准确率相对较低78% 相似待验证中文转写准确率标称值需按场景打折:安静环境标称95%以上机型,实际多人交叉说话/带口音时会掉到70-80%,方言支持是硬门槛,购买前确认是否支持粤语/四川话等目标方言73% 相似待验证同样的中文文本在不同大模型服务商处消耗的 Token 数量可能相差 30%-50%71% 相似待验证中文版本虽已本土化,但中国本土常模的样本量和行业覆盖度不如英语市场成熟,对于部分细分行业或基层岗位的常模参照精度可能不足;采购前应确认供应商能否提供匹配目标岗位层级的参照常模71% 相似待验证中文场景下通常需要选择专门针对中文语料训练的Embedding模型,以保证语义表达的准确性和检索质量70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/43192API
curl https://kongchang.com/api/v1/knowledge/claims/43192MCP
get_claim(id=43192)