Unverified50% confidenceBenchmarkExact time
在实验中,零样本生成任务解决率为17%,通用自我纠错为27%,仅错误反馈为23%,诊断性反例反馈(A-CEGIS)达到90%
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Unverified压测场景下错误率(Error Rate)通常要求低于0.1%73% similarUnverified测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)71% similarUnverified在实验中当提示超过50条后,人类的拦截率从17%骤降到5%,体现审批疲劳现象71% similarUnverified检测项越多单项成本越低,但假阳性率随项目数上升——40+项的大panel常出现多项弱阳性(0.35–0.7 kU/L),临床意义模糊,反而增加不必要的忌口焦虑;无明确症状时选10–20项精准panel优于盲测大panel69% similarUnverified在一个396个文件的大型混合职责项目上测试时,召回率几乎跌到零69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/897321API
curl https://kongchang.com/api/v1/knowledge/claims/897321MCP
get_claim(id=897321)