待验证50% 置信基准精确时间
在吞吐量方面,TwIL-LM3 达到 32.9 answers/sec,gpt-oss-120b 为 12.6 answers/sec
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/12
首次发现
有效期至:2026/12/11
来源
涉及实体
相关事实
待验证在规则归纳(Rule Induction)任务上,TwIL-LM3 得分96.4,gpt-oss-120b 得分65.276% 相似待验证通义千问3.6 27B在语义三次全对率和格式正确率上均领先Muse Glimmer68% 相似待验证Llama 3.1 405B在MMLU上的得分已接近GPT-4o的水平,Qwen 2.5 72B在数学和代码生成基准上某些指标超越了GPT-4 Turbo65% 相似待验证在严格格式评分测试中,TwIL-LM 的 1.7B 模型据称击败了体量是其 5 到 15 倍的模型65% 相似待验证Qwen2.5-72B 在多项基准测试中接近 Llama-3.1-405B 的表现64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/916085API
curl https://kongchang.com/api/v1/knowledge/claims/916085MCP
get_claim(id=916085)