待验证50% 置信事实精确时间
SkillBench专注于测量模型+Skill组合系统在特定任务上的增量性能,与MMLU、HumanEval等衡量模型通用能力的传统基准不同
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/19
首次发现
有效期至:2026/10/17
来源
相关事实
待验证Skill机制采用按需加载方式,先发送所有Skill的元数据给大模型,大模型选择匹配的Skill后再加载完整指令75% 相似待验证SKILL.md 中显式描述工作流可以将模型行为锁定在可预期的执行路径上,提升任务完成质量75% 相似待验证技能库采用懒加载设计,Agent Harness 只需解析 Front Matter 即可判断是否激活某个技能,从而规模化扩展而不显著增加 token 消耗75% 相似已验证Skills是一个专门为测试人员设计的工具平台75% 相似待验证将技能元数据向量化并存入向量数据库(如Pinecone、Weaviate)可实现Agent技能的语义检索发现73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/564424API
curl https://kongchang.com/api/v1/knowledge/claims/564424MCP
get_claim(id=564424)