Unverified50% confidenceBenchmarkExact time
反讽检测任务在标准数据集(如iSarcasm、SemEval系列)上的最佳F1分数长期徘徊在70%-80%区间
1
Sources
50%
Confidence
Long-term
Relevance
9/4/2026
First Seen
Sources
Related Entities
Related Claims
Unverified该模型的F1分数为72%,数据存在严重的类别不平衡,比例为89:1169% similarUnverified实验数据显示关键信息位于输入序列首尾时模型检索准确率可高达90%以上,位于中段时可能骤降至60%以下64% similarUnverified评分接近满分(如4.9+)但评价数极少的平台/司机需警惕刷分,应重点看100条以上真实差评的集中问题(加价、迟到、损坏物品),而非只看总评分64% similarUnverifiedPrompt优先方案(用一条超长指令串起数据分析流程)实测成功率不到40%62% similarUnverified在漏洞检测基准测试中,让最新模型运行五次,只有50%的漏洞被稳定发现,相比确定性检查工具LLM只发现75%的问题,F1分数仅为40%61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/855286API
curl https://kongchang.com/api/v1/knowledge/claims/855286MCP
get_claim(id=855286)