Unverified50% confidenceBenchmarkExact time
训练完成后,Needle在30个测试样本上取得了96.7%的F1调用得分
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
26M超轻量模型Needle:本地微调工具调用全流程实战
bilibili薛定猫AI7/3/2026
Related Claims
Unverified引导模式下平均端到端准确率从28.6%提升到33.7%,歧义检测F1值从45.3%提升到64.9%70% similarUnverifiedQwen 3.6 Max中性模式下歧义检测F1仅16%,平均每任务只问0.07个问题,但一旦提问澄清准确率高达94.7%66% similarUnverified混合精度训练中,FP16 每个参数占 2 字节显存,FP32 每个参数占 4 字节显存60% similarUnverifiedBullet 在 SWE-bench Verified 基准测试中取得 95.8% 的成绩,位列前三,平均每个任务耗时 119 秒57% similarUnverifiedAccording to the MedViT paper, the model achieved a Macro F1 score of 0.7791 on ChestX-ray1455% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/112997API
curl https://kongchang.com/api/v1/knowledge/claims/112997MCP
get_claim(id=112997)