待验证50% 置信基准精确时间
在公开的中文医疗ASR基准测试中通用模型的医疗术语召回率通常在70%-85%之间
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/5
首次发现
有效期至:2026/11/3
来源
相关事实
待验证普通话通用场景识别准确率≥95%已是主流水平,选购时应重点看专业领域/口音/多人会议等复杂场景的实测准确率,官方宣称的98%通常是标准朗读环境数据62% 相似已验证LLM-as-Judge方法与人类专家评分的一致性可达80%以上62% 相似待验证2024年的多项研究表明,LLM裁判与人类专家的一致率通常在70%-85%之间61% 相似待验证中文垂直场景(医疗/法律/金融)应选支持热词/自学习模型的API,通用模型在专业术语上识别率可能骤降10-20个百分点,热词功能可显著挽回准确率60% 相似待验证LLM-as-Judge方法由Zheng等人在2023年的MT-Bench论文中系统验证,与人类评估的一致性可达80%以上60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/687633API
curl https://kongchang.com/api/v1/knowledge/claims/687633MCP
get_claim(id=687633)