待验证50% 置信事实精确时间
2023年微软研究论文《LIMA: Less Is More for Alignment》表明仅用1000条精心策划的高质量样本就能让基座模型展现出与数万条样本微调相当的对话能力
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证题量并非越多越好:低于60题的测评难以覆盖多维度、信度不足;但超过300题会因答题疲劳导致后半段数据质量下降。个人自测选100-150题、20分钟内完成的版本较为均衡66% 相似部分验证微调数据的质量远比数量重要,通常几百到几千条高质量标注数据就能显著提升模型在特定任务上的表现66% 相似待验证题目数量多与单题质量常成反比,200题以上的合集本多为压缩排版、每题差异雷同;50-100题的精编本主题设计和难度梯度更用心66% 相似待验证该测试样本规模相对有限(5个模型、13个代码库),结论有待更大规模验证65% 相似待验证全模态大模型虽然支持语音输入输出,但在智能体基准测试上的得分远远低于主流推理模型65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/892733API
curl https://kongchang.com/api/v1/knowledge/claims/892733MCP
get_claim(id=892733)