Unverified50% confidenceBenchmarkExact time
在规则归纳(Rule Induction)任务上,TwIL-LM3 得分96.4,gpt-oss-120b 得分65.2
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/12/2026
First Seen
Valid until: 12/11/2026
Sources
Related Entities
Related Claims
UnverifiedLlama 3.1 405B在MMLU上的得分已接近GPT-4o的水平,Qwen 2.5 72B在数学和代码生成基准上某些指标超越了GPT-4 Turbo77% similarUnverified在吞吐量方面,TwIL-LM3 达到 32.9 answers/sec,gpt-oss-120b 为 12.6 answers/sec76% similarUnverifiedLFM2.5在BFCL-v3和BFCL-v4工具调用评测中分别比上代提升了19和23个点65% similarUnverified在严格格式评分测试中,TwIL-LM 的 1.7B 模型据称击败了体量是其 5 到 15 倍的模型64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/916084API
curl https://kongchang.com/api/v1/knowledge/claims/916084MCP
get_claim(id=916084)