Unverified50% confidenceBenchmarkExact time
引导模式下平均端到端准确率从28.6%提升到33.7%,歧义检测F1值从45.3%提升到64.9%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/9/2026
First Seen
Valid until: 10/7/2026
Sources
腾讯DiscoBench:评测LLM搜索代理歧义澄清能力的首个基准
bilibili熊二等兵7/4/2026
Related Claims
Unverified训练完成后,Needle在30个测试样本上取得了96.7%的F1调用得分70% similarUnverifiedClaude Opus 4.7中间检查点通过率达57%,最终准确率却只有39.8%70% similarUnverified在同一模型(Claude 4.6 Opus)下,OCR的精度(Precision)为33.9%,通用Agent为7.23%,OCR精度提升约4.7倍69% similarUnverifiedFP8量化相比FP16原始精度,在主流benchmark上的性能下降通常不超过1-2%68% similarUnverifiedQwen 3.6 Max中性模式下歧义检测F1仅16%,平均每任务只问0.07个问题,但一旦提问澄清准确率高达94.7%68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/387226API
curl https://kongchang.com/api/v1/knowledge/claims/387226MCP
get_claim(id=387226)