待验证50% 置信基准精确时间
斯坦福大学2023年发表研究《How Is ChatGPT's Behavior Changing over Time?》,以实验证明同一模型不同部署版本在代码生成、逻辑推理等任务上通过率可能出现10%至20%的显著波动
1
来源数
50%
置信度
长期有效
时效性
2026/7/22
首次发现
来源
相关事实
待验证该研究发现同一模型不同部署时间点在代码生成和逻辑推理任务上通过率可能出现10%至20%的显著波动,且方向不总是单向改善74% 相似待验证斯坦福大学2023年研究表明,GPT-4V等多模态模型解析嵌套条件逻辑流程图时,准确率比等效文字描述低约15-25个百分点66% 相似待验证斯坦福大学2023年的研究表明,引入明确的需求分析和设计阶段后,LLM生成代码的功能正确率提升约30%63% 相似待验证斯坦福的一项研究发现,71%人们向ChatGPT提出的问题可以由本地运行的模型来回答62% 相似待验证2024年一项研究对GPT-4在Temperature=0下的代码生成任务进行100次测试,发现约8%的测试用例存在跨次运行的输出差异62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/593812API
curl https://kongchang.com/api/v1/knowledge/claims/593812MCP
get_claim(id=593812)