产品Moderation API
OpenAI Moderation API
OpenAI提供的内容审核API,是独立于主语言模型的文本分类模型,用于检测仇恨、自残、违法活动等多类有害内容,与主模型解耦运行
时间轴 (近 90 天)
8月30日
OpenAI的Moderation API和Meta的Llama Guard系列是基于分类模型的护栏,使用专门训练的小型模型对内容进行安全分类
待验证60%
OpenAI提供的内容审核API,是独立于主语言模型的文本分类模型,用于检测仇恨、自残、违法活动等多类有害内容,与主模型解耦运行
OpenAI的Moderation API和Meta的Llama Guard系列是基于分类模型的护栏,使用专门训练的小型模型对内容进行安全分类