待验证50% 置信基准精确时间
对于包含复杂表格的财务报告,简单文本提取与结构感知解析之间下游问答准确率差距可达30个百分点以上
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/8
首次发现
有效期至:2026/10/6
来源
OfficeCLI:专为AI智能体设计的Office文档读写命令行工具
hackernewshackernews2026/7/6
相关事实
待验证在提示中包含具体评估维度(如格式、字数、覆盖要点、排除事项)比模糊提示平均可提升模型输出质量30%-50%73% 相似待验证测评题量与信度存在权衡:低于30题的『快测』因抽样不足信度偏低,但200题以上的专业量表易产生答题疲劳导致后半段随意作答,60-120题是兼顾信度与完成质量的区间71% 相似待验证题量并非越多越好:低于60题的测评难以覆盖多维度、信度不足;但超过300题会因答题疲劳导致后半段数据质量下降。个人自测选100-150题、20分钟内完成的版本较为均衡71% 相似待验证针对金融领域微调的嵌入模型(如FinBERT)相比通用嵌入模型在财报问答任务上准确率高出15%以上70% 相似待验证在某些测试中,文档中间段信息的检索准确率比首尾段低40%以上69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/231262API
curl https://kongchang.com/api/v1/knowledge/claims/231262MCP
get_claim(id=231262)