[控场AI]
产品Moderation API

OpenAI Moderation API

OpenAI提供的内容审核API,是独立于主语言模型的文本分类模型,用于检测仇恨、自残、违法活动等多类有害内容,与主模型解耦运行

时间轴 (近 90 天)

8月30日

OpenAI的Moderation API和Meta的Llama Guard系列是基于分类模型的护栏,使用专门训练的小型模型对内容进行安全分类

待验证60%

全部知识事实 (1)

来源文章