[控场AI]
概念Zero-shot Classification / 零样本分类器

零样本分类

基于预训练大语言模型语义理解能力的文本分类方法,无需针对目标任务收集标注训练数据,仅凭目标类别的文字描述即可判断文本匹配程度,常用BART、RoBERTa等NLI变体模型实现

核心事实

时间轴 (近 90 天)

10月5日

零样本模型无需标注数据,只要用自然语言写清楚标签就能给出分类结果

待验证50%
10月5日

当数据充足、类别稳定、成本敏感、流量大时优先训练分类器;当无数据、需快速验证、类别多变时零样本是更合适的起点

待验证50%
10月5日

推荐路径是早期用零样本快速起步,中期用零样本输出做弱标注构建初始训练集,成熟期迁移到专用分类器降本增效

待验证50%
10月5日

弱监督标签的质量上限取决于零样本模型本身的准确率,若模型系统性出错训练集会继承该偏差

待验证50%
10月5日

零样本分类的弱点在于对边界模糊、领域专有的类别判断不够稳定,推理成本随流量线性增长,结果可解释性和可复现性较差

待验证50%
10月3日

零样本分类器(如基于CLIP或NLI的方案)允许用户以自然语言描述类别,灵活性更高但通常需要更大的基础模型

待验证50%
9月24日

零样本分类的所有候选项得分之和为 1,候选项越少各项可获得的概率空间越大,因此阈值参数需根据具体类别数量单独校准

待验证50%
9月24日

Laya 采用零样本分类范式,其底层通常基于经过自然语言推理(NLI)任务微调的预训练语言模型

待验证50%
9月14日

研究采用无监督主题建模从评论文本中自动识别讨论主题,再用零样本分类将主题归入五个食物获取维度

待验证50%
9月14日

零样本分类依托预训练大语言模型如BART、RoBERTa的NLI变体的语义理解能力

已验证75%

还有 1 条时间轴事件

全部知识事实 (11)

已验证

零样本分类依托预训练大语言模型如BART、RoBERTa的NLI变体的语义理解能力

75%
待验证

零样本模型无需标注数据,只要用自然语言写清楚标签就能给出分类结果

50%
待验证

当数据充足、类别稳定、成本敏感、流量大时优先训练分类器;当无数据、需快速验证、类别多变时零样本是更合适的起点

50%
待验证

推荐路径是早期用零样本快速起步,中期用零样本输出做弱标注构建初始训练集,成熟期迁移到专用分类器降本增效

50%
待验证

弱监督标签的质量上限取决于零样本模型本身的准确率,若模型系统性出错训练集会继承该偏差

50%
待验证

零样本分类的弱点在于对边界模糊、领域专有的类别判断不够稳定,推理成本随流量线性增长,结果可解释性和可复现性较差

50%
待验证

零样本分类器(如基于CLIP或NLI的方案)允许用户以自然语言描述类别,灵活性更高但通常需要更大的基础模型

50%
待验证

零样本分类的所有候选项得分之和为 1,候选项越少各项可获得的概率空间越大,因此阈值参数需根据具体类别数量单独校准

50%
待验证

Laya 采用零样本分类范式,其底层通常基于经过自然语言推理(NLI)任务微调的预训练语言模型

50%
待验证

研究采用无监督主题建模从评论文本中自动识别讨论主题,再用零样本分类将主题归入五个食物获取维度

50%
待验证

机器分类结果与人工编码对照达到了85.4%的一致率

50%

来源文章