待验证50% 置信基准精确时间
在Qwen-3.5-4B-Instruct上,75.6%的有效性评分认为主轴两极生成结果准确对应其标签,标注者相邻一致率高达90.9%
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证在Qwen-3.5-4B-Instruct模型上,前两条主轴与人类自发请求的风格维度匹配精确率达72.8%,宏平均召回率43.6%73% 相似待验证4Bit量化下模型的基准测试得分通常能保持原始精度的90%-95%72% 相似待验证Qwen3.7 Max的输出质量高度依赖提示词质量,同一模型在不同提示词下的性能差异可高达30%-50%68% 相似待验证Qwen 3 Max综合八项测试获得65分,得分率81.25%,在测评者排行榜上位居第二,仅次于得分82.5%的Claude旗舰67% 相似待验证Qwen3 27B在OpenAI HumanEval 164道Python题上取得85%通过率和99%应答率67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/931131API
curl https://kongchang.com/api/v1/knowledge/claims/931131MCP
get_claim(id=931131)