Unverified50% confidenceBenchmarkExact time
在与人类判断的对齐度上,DeepInstructor 的 Hit@1 提升了 24.4%
1
Sources
50%
Confidence
Long-term
Relevance
9/22/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedDude相比基线方法,在召回率和精确率上最高提升了22.8%61% similarUnverified在通用智能体任务上Glimmer得分达24%,高于Qwen的17%60% similarUnverifiedArtificial Analysis给Muse Glimmer 30B打出35分的智能指数,相比Llama 4 Maverick是巨大飞跃56% similarUnverified该框架在稀有实体切片上的准确率提升最高达到23.3%56% similarUnverified在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%56% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/940087API
curl https://kongchang.com/api/v1/knowledge/claims/940087MCP
get_claim(id=940087)