待验证60% 置信事实时间未知
同一个基座模型在不同系统提示词下的表现差异可以高达30-50个百分点
1
来源数
60%
置信度
长期有效
时效性
2026/6/3
首次发现
来源
Hermes Agent自我进化机制深度解析:GIPA算法与工程实践
bilibili探索未至之境
涉及实体
相关事实
待验证Research shows that the same base LLM model can vary by 30-50 percentage points in performance under different system prompts.79% 相似待验证同一套系统提示在不同模型上的效果差异可能超过30%,这是商业Harness需要针对每个模型单独维护提示版本的原因74% 相似待验证一个61分的模型和一个59分的模型在多数实际应用中的差异可能远小于分数暗示的程度73% 相似待验证在提示中包含具体评估维度(如格式、字数、覆盖要点、排除事项)比模糊提示平均可提升模型输出质量30%-50%72% 相似部分验证研究表明,同一模型在不同提示词下的输出质量可能相差数倍70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/39640API
curl https://kongchang.com/api/v1/knowledge/claims/39640MCP
get_claim(id=39640)