Unverified50% confidenceBenchmarkExact time
在Qwen-3.5-4B-Instruct上,75.6%的有效性评分认为主轴两极生成结果准确对应其标签,标注者相邻一致率高达90.9%
1
Sources
50%
Confidence
Long-term
Relevance
9/18/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在Qwen-3.5-4B-Instruct模型上,前两条主轴与人类自发请求的风格维度匹配精确率达72.8%,宏平均召回率43.6%73% similarUnverified4Bit量化下模型的基准测试得分通常能保持原始精度的90%-95%72% similarUnverifiedQwen3.7 Max的输出质量高度依赖提示词质量,同一模型在不同提示词下的性能差异可高达30%-50%68% similarUnverifiedQwen 3 Max综合八项测试获得65分,得分率81.25%,在测评者排行榜上位居第二,仅次于得分82.5%的Claude旗舰67% similarUnverifiedQwen3 27B在OpenAI HumanEval 164道Python题上取得85%通过率和99%应答率67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/931131API
curl https://kongchang.com/api/v1/knowledge/claims/931131MCP
get_claim(id=931131)