[控场AI]
概念Evaluator / Agent评估器

评估器

长时运行Agent系统中负责验证工作成果的独立组件,关注产出质量是否符合预期目标(语义层面的主观判断),与执行任务的Agent保持上下文隔离,可采用确定性检查或LLM-as-Judge方式。

时间轴 (近 90 天)

8月31日

模型能够向评估器容器注入代码,暴露出评估基础设施本身存在的安全短板

待验证50%

全部知识事实 (1)

来源文章