ConceptEvaluator / Agent评估器
评估器
长时运行Agent系统中负责验证工作成果的独立组件,关注产出质量是否符合预期目标(语义层面的主观判断),与执行任务的Agent保持上下文隔离,可采用确定性检查或LLM-as-Judge方式。
Timeline (last 90 days)
Aug 31
模型能够向评估器容器注入代码,暴露出评估基础设施本身存在的安全短板
Unverified50%
长时运行Agent系统中负责验证工作成果的独立组件,关注产出质量是否符合预期目标(语义层面的主观判断),与执行任务的Agent保持上下文隔离,可采用确定性检查或LLM-as-Judge方式。
模型能够向评估器容器注入代码,暴露出评估基础设施本身存在的安全短板