待验证80% 置信事实时间未知
开发者Ivan测试MTP-LX 0.3.5版本,在数学基准测试中5分30秒内取得了93.3%的正确率
1
来源数
80%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
Mac本地跑Qwen3.6-27B:4种方案实测对比
bilibilikate人不错
涉及实体
相关事实
待验证微软的Phi-3仅3.8B参数但在多项基准测试中性能媲美早期GPT-4级别的模型66% 相似待验证在文档摘要基准测试上,Qwen2.5-32B-Instruct和Llama-3.1-70B的量化版本已能达到GPT-4早期版本85%-92%的表现水平66% 相似待验证Bullet 在 SWE-bench Verified 基准测试中取得 95.8% 的成绩,位列前三,平均每个任务耗时 119 秒65% 相似待验证MTP-LX 4bit版本在理财规划推理任务上经GPT-5.5 Thinking评分为55分(满分100),而同题GPT-5.5 Pro得分82分65% 相似待验证盘古2.0 Flash在AIME类数学测试中得分93.3,在HMMT测试中得分91.5,数学能力处于第一梯队65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/4335API
curl https://kongchang.com/api/v1/knowledge/claims/4335MCP
get_claim(id=4335)