Unverified50% confidenceBenchmarkExact time
在BU Bench V1上,4B参数的SFT模型超越了DeepSeek V4 Pro和Kimi K2.6在开源Browser Use框架下报告的45%成绩
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/7/2026
First Seen
Valid until: 12/6/2026
Sources
Related Entities
Related Claims
UnverifiedDeepSeek V4 Pro's Terminal Bench score is slightly above open-source models Kimi K2.6, GLM 5.1, and Minimax M2.772% similarUnverifiedQwen3-4B在多项推理类评测指标上已与DeepSeek V3或GPT-4o相差无几69% similarUnverified在SWE-Bench Pro上,HY3以57.9分反超DeepSeek V4 Pro的55.4分67% similarUnverifiedKimi K2.6在SWE Bench Pro、深度搜索问答和Humanity's Last Exam等顶级基准测试上与GPT 5.4、Claude Opus 4.6和Gemini 3.1 Pro等闭源模型竞争66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/869644API
curl https://kongchang.com/api/v1/knowledge/claims/869644MCP
get_claim(id=869644)