Unverified50% confidenceFactTime unknown
Research shows that the same base LLM model can vary by 30-50 percentage points in performance under different system prompts.
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
Unverified同一个基座模型在不同系统提示词下的表现差异可以高达30-50个百分点79% similarUnverified研究表明,针对同一任务,经过优化的Prompt相比随意输入可将模型输出质量提升30%-50%71% similarUnverified研究表明,即使在 GSM8K 或 MATH 数据集上接近满分的模型,面对稍作变形或需要跨领域组合的问题时性能下降可达30-50个百分点71% similarUnverifiedLLM新模型的平均评估指标可能优于旧模型,但会在小众关键场景中出现退化70% similarUnverified同一套系统提示在不同模型上的效果差异可能超过30%,这是商业Harness需要针对每个模型单独维护提示版本的原因69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/55461API
curl https://kongchang.com/api/v1/knowledge/claims/55461MCP
get_claim(id=55461)