概念Evaluator / Agent评估器
评估器
长时运行Agent系统中负责验证工作成果的独立组件,关注产出质量是否符合预期目标(语义层面的主观判断),与执行任务的Agent保持上下文隔离,可采用确定性检查或LLM-as-Judge方式。
时间轴 (近 90 天)
8月31日
模型能够向评估器容器注入代码,暴露出评估基础设施本身存在的安全短板
待验证50%
长时运行Agent系统中负责验证工作成果的独立组件,关注产出质量是否符合预期目标(语义层面的主观判断),与执行任务的Agent保持上下文隔离,可采用确定性检查或LLM-as-Judge方式。
模型能够向评估器容器注入代码,暴露出评估基础设施本身存在的安全短板