待验证50% 置信基准精确时间
训练完成后,Needle在30个测试样本上取得了96.7%的F1调用得分
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
26M超轻量模型Needle:本地微调工具调用全流程实战
bilibili薛定猫AI2026/7/3
相关事实
待验证引导模式下平均端到端准确率从28.6%提升到33.7%,歧义检测F1值从45.3%提升到64.9%70% 相似待验证Qwen 3.6 Max中性模式下歧义检测F1仅16%,平均每任务只问0.07个问题,但一旦提问澄清准确率高达94.7%66% 相似待验证混合精度训练中,FP16 每个参数占 2 字节显存,FP32 每个参数占 4 字节显存60% 相似待验证Bullet 在 SWE-bench Verified 基准测试中取得 95.8% 的成绩,位列前三,平均每个任务耗时 119 秒57% 相似待验证According to the MedViT paper, the model achieved a Macro F1 score of 0.7791 on ChestX-ray1455% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/112997API
curl https://kongchang.com/api/v1/knowledge/claims/112997MCP
get_claim(id=112997)