Unverified50% confidenceFactExact time
SkillBench专注于测量模型+Skill组合系统在特定任务上的增量性能,与MMLU、HumanEval等衡量模型通用能力的传统基准不同
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/19/2026
First Seen
Valid until: 10/17/2026
Sources
Related Claims
UnverifiedSkill机制采用按需加载方式,先发送所有Skill的元数据给大模型,大模型选择匹配的Skill后再加载完整指令75% similarUnverifiedSKILL.md 中显式描述工作流可以将模型行为锁定在可预期的执行路径上,提升任务完成质量75% similarUnverified技能库采用懒加载设计,Agent Harness 只需解析 Front Matter 即可判断是否激活某个技能,从而规模化扩展而不显著增加 token 消耗75% similarVerifiedSkills是一个专门为测试人员设计的工具平台75% similarUnverified将技能元数据向量化并存入向量数据库(如Pinecone、Weaviate)可实现Agent技能的语义检索发现73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/564424API
curl https://kongchang.com/api/v1/knowledge/claims/564424MCP
get_claim(id=564424)