待验证50% 置信基准精确时间
2024年一项研究对GPT-4在Temperature=0下的代码生成任务进行100次测试,发现约8%的测试用例存在跨次运行的输出差异
1
来源数
50%
置信度
长期有效
时效性
2026/7/9
首次发现
来源
Context Warp Drive:AI智能体确定性上下文折叠详解
hackernewshackernews2026/7/7
相关事实
待验证测试LLM引用行为时应对同一提示至少运行20—50次,理想情况下扩大至100次以上69% 相似待验证斯坦福大学2023年研究表明,GPT-4V等多模态模型解析嵌套条件逻辑流程图时,准确率比等效文字描述低约15-25个百分点69% 相似待验证2024 年的多项基准测试表明,经过严格安全对齐的模型在代码生成任务上的拒绝率比基座模型高出 15-30%,在创意写作任务上的自我审查率高达 40%69% 相似待验证自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上67% 相似待验证模型能力的代际差距正在缩小,多家模型在部分基准测试上已接近甚至超越GPT-4的推理优势67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/319431API
curl https://kongchang.com/api/v1/knowledge/claims/319431MCP
get_claim(id=319431)