Unverified50% confidenceFactTime unknown
美团技术团队发布General 365推理评测基准,对26款主流大模型进行测试,大部分模型未能达到60分及格线
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
AI日报:OpenClaw性能提升3.5倍,Copilot Memory开放,编程工具全面进化
bilibili硅基米德AI
Related Claims
Unverified2022年Hoffman等人的Chinchilla论文重新校准了算力最优的参数-数据比例,指出此前许多大模型训练不充分67% similarUnverified该项目的50个样本属于概念验证级别,在更大规模真实生产环境中准确率可能出现波动67% similarUnverifiedLovable在四维度评测中总分为56/100,迭代效率满分但部署和集成表现较差67% similarUnverified2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力67% similarUnverified2023年的TruthfulQA基准测试显示,即便是当时最强的模型,在需要精确事实判断的问题上准确率也未超过60%66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/57166API
curl https://kongchang.com/api/v1/knowledge/claims/57166MCP
get_claim(id=57166)