Unverified50% confidenceBenchmarkExact time
2024年一项研究对GPT-4在Temperature=0下的代码生成任务进行100次测试,发现约8%的测试用例存在跨次运行的输出差异
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
Context Warp Drive:AI智能体确定性上下文折叠详解
hackernewshackernews7/7/2026
Related Claims
Unverified测试LLM引用行为时应对同一提示至少运行20—50次,理想情况下扩大至100次以上69% similarUnverified斯坦福大学2023年研究表明,GPT-4V等多模态模型解析嵌套条件逻辑流程图时,准确率比等效文字描述低约15-25个百分点69% similarUnverified2024 年的多项基准测试表明,经过严格安全对齐的模型在代码生成任务上的拒绝率比基座模型高出 15-30%,在创意写作任务上的自我审查率高达 40%69% similarUnverified自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上67% similarUnverified模型能力的代际差距正在缩小,多家模型在部分基准测试上已接近甚至超越GPT-4的推理优势67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/319431API
curl https://kongchang.com/api/v1/knowledge/claims/319431MCP
get_claim(id=319431)