待验证50% 置信基准精确时间
反讽检测任务在标准数据集(如iSarcasm、SemEval系列)上的最佳F1分数长期徘徊在70%-80%区间
1
来源数
50%
置信度
长期有效
时效性
2026/9/4
首次发现
来源
涉及实体
相关事实
待验证该模型的F1分数为72%,数据存在严重的类别不平衡,比例为89:1169% 相似待验证实验数据显示关键信息位于输入序列首尾时模型检索准确率可高达90%以上,位于中段时可能骤降至60%以下64% 相似待验证评分接近满分(如4.9+)但评价数极少的平台/司机需警惕刷分,应重点看100条以上真实差评的集中问题(加价、迟到、损坏物品),而非只看总评分64% 相似待验证Prompt优先方案(用一条超长指令串起数据分析流程)实测成功率不到40%62% 相似待验证在漏洞检测基准测试中,让最新模型运行五次,只有50%的漏洞被稳定发现,相比确定性检查工具LLM只发现75%的问题,F1分数仅为40%61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/855286API
curl https://kongchang.com/api/v1/knowledge/claims/855286MCP
get_claim(id=855286)