[KongchangAI]
ConceptEvaluator / Agent评估器

评估器

长时运行Agent系统中负责验证工作成果的独立组件,关注产出质量是否符合预期目标(语义层面的主观判断),与执行任务的Agent保持上下文隔离,可采用确定性检查或LLM-as-Judge方式。

Timeline (last 90 days)

Aug 31

模型能够向评估器容器注入代码,暴露出评估基础设施本身存在的安全短板

Unverified50%

All Facts (1)

Source Articles