待验证60% 置信基准精确时间
Berkeley Function-Calling Leaderboard(BFCL)是业界常用的工具调用能力评估基准之一
2
来源数
60%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
Meta Muse Spark 1.1发布:首个开放API的Spark模型全面解析
rss2026/7/9
相关事实
待验证评估模型智能体能力的主流基准测试包括BFCL(Berkeley Function Calling Leaderboard)、AgentBench、SWE-Bench;编码能力评测集包括HumanEval、MBPP、LiveCodeBench73% 相似待验证模型能力评估如CBRN(化学、生物、放射、核武器相关能力测试)已成为大型实验室内部发布流程的标准环节56% 相似待验证斯坦福的IFEval、清华的FollowBench是评估模型指令遵循能力的基准测试55% 相似待验证Function Calling能力通过SFT阶段构造大量工具调用示例数据获得,结合RLHF优化工具选择准确性53% 相似待验证责任扩展政策的设计灵感来源于生物安全领域的生物安全等级(BSL-1到BSL-4)分级体系52% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/500643API
curl https://kongchang.com/api/v1/knowledge/claims/500643MCP
get_claim(id=500643)