Unverified50% confidenceFactExact time
pass@1指标最初从代码生成评测领域(如HumanEval基准)借鉴而来,用于衡量模型一次生成正确代码的概率
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
Unverifiedpass@k指标衡量模型生成k个候选代码片段时至少有一个能通过全部测试用例的概率68% similarUnverified传统代码评测基准(如HumanEval、MBPP)主要测试模型在孤立函数级别的生成准确率66% similarUnverifiedHumanEval、SWE-bench等代码评测基准的排名是评估执行型Agent底层模型选型的重要参考维度65% similarUnverified在Pass@1 Codeforces基准测试中,o1和o1 pro得分非常接近64% similarUnverifiedHumanEval通过让模型根据函数签名和文档字符串生成完整函数实现来衡量编码准确率64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/507772API
curl https://kongchang.com/api/v1/knowledge/claims/507772MCP
get_claim(id=507772)