Unverified60% confidenceBenchmarkExact time
Berkeley Function-Calling Leaderboard(BFCL)是业界常用的工具调用能力评估基准之一
2
Sources
60%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
Meta Muse Spark 1.1发布:首个开放API的Spark模型全面解析
rss7/9/2026
Related Claims
Unverified评估模型智能体能力的主流基准测试包括BFCL(Berkeley Function Calling Leaderboard)、AgentBench、SWE-Bench;编码能力评测集包括HumanEval、MBPP、LiveCodeBench73% similarUnverified模型能力评估如CBRN(化学、生物、放射、核武器相关能力测试)已成为大型实验室内部发布流程的标准环节56% similarUnverified斯坦福的IFEval、清华的FollowBench是评估模型指令遵循能力的基准测试55% similarUnverifiedFunction Calling能力通过SFT阶段构造大量工具调用示例数据获得,结合RLHF优化工具选择准确性53% similarUnverified责任扩展政策的设计灵感来源于生物安全领域的生物安全等级(BSL-1到BSL-4)分级体系52% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/500643API
curl https://kongchang.com/api/v1/knowledge/claims/500643MCP
get_claim(id=500643)