Unverified50% confidenceFactExact time
Inspect 是一个开源的大语言模型评估框架,目标是为 LLM 的能力评测提供通用基础设施
1
Sources
50%
Confidence
Long-term
Relevance
9/30/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedLLM智能体运行时监控方案主要包括三类:工具调用序列分析、权限使用审计和因果追踪70% similarUnverified开源提示注入检测工具的实现思路大致分为基于关键词与规则的模式匹配、基于分类模型的语义识别、以及利用LLM作为裁判判断注入意图三类69% similarUnverified评估大语言模型智能通常依赖标准化基准测试,涵盖数学推理、代码生成、常识推理和长上下文理解等维度67% similarUnverified指令遵循能力(Instruction Following)是NLP领域一个独立的评估维度,专门的评测基准包括IFEval、FollowBench67% similarUnverifiedPromptfoo是一款开源的LLM评估框架,以YAML配置文件描述测试用例、通过CLI执行评估,风格类似PyTest,支持精确匹配、正则、语义相似度、调用外部LLM作为裁判等多种断言类型67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/960955API
curl https://kongchang.com/api/v1/knowledge/claims/960955MCP
get_claim(id=960955)