PTC-Bias
一种基于音素级时间竞争的上下文偏置框架,通过两阶段(检索+纠正)设计提升语音大模型对稀有词的识别准确率,无需额外SpeechLLM前向计算
时间轴 (近 90 天)
PTC-Bias 是一种基于音素级时间竞争的两阶段上下文偏置框架,用于提升语音大模型对稀有词的识别
PTC-Bias 将流程拆分为 PTC 检索和 PTC 纠正两个阶段
PTC 检索在预填充阶段执行帧同步的音素解码,让候选词发音在时间轴上竞争,筛选出紧凑的候选偏置词短名单并定位对应语音区间
PTC 纠正在语音区间内对检索到的候选词与转写文本不匹配的片段进行局部竞争,专门针对近音词和分词错误
PTC-Bias 的两个阶段共享同一套音素后验概率,不需要额外的 SpeechLLM 前向传播
论文在 LibriSpeech 数据集上进行验证,覆盖两种不同的 SpeechLLM,偏置词表最大规模达到 2000 词
使用 Prompt-SLAM-ASR-7B 模型配合 2000 词偏置列表时,在 test-clean 测试集上 B-WER 相对 CTC-Filter 基线降低了 23.4%
在 test-other 测试集上,B-WER 相对 CTC-Filter 基线降低了 23.9%
PTC-Bias 在降低 B-WER 的同时,U-WER(非偏置词错误率)基本保持不变
PTC-Bias 当前实验主要基于英文 LibriSpeech 数据集和特定 SpeechLLM,在中文等其他语言、真实嘈杂环境及更大偏置词表下的表现仍有待验证
全部知识事实 (10)
PTC-Bias 是一种基于音素级时间竞争的两阶段上下文偏置框架,用于提升语音大模型对稀有词的识别
50%待验证PTC-Bias 将流程拆分为 PTC 检索和 PTC 纠正两个阶段
50%待验证PTC 检索在预填充阶段执行帧同步的音素解码,让候选词发音在时间轴上竞争,筛选出紧凑的候选偏置词短名单并定位对应语音区间
50%待验证PTC 纠正在语音区间内对检索到的候选词与转写文本不匹配的片段进行局部竞争,专门针对近音词和分词错误
50%待验证PTC-Bias 的两个阶段共享同一套音素后验概率,不需要额外的 SpeechLLM 前向传播
50%待验证论文在 LibriSpeech 数据集上进行验证,覆盖两种不同的 SpeechLLM,偏置词表最大规模达到 2000 词
50%待验证使用 Prompt-SLAM-ASR-7B 模型配合 2000 词偏置列表时,在 test-clean 测试集上 B-WER 相对 CTC-Filter 基线降低了 23.4%
50%待验证在 test-other 测试集上,B-WER 相对 CTC-Filter 基线降低了 23.9%
50%待验证PTC-Bias 在降低 B-WER 的同时,U-WER(非偏置词错误率)基本保持不变
50%待验证PTC-Bias 当前实验主要基于英文 LibriSpeech 数据集和特定 SpeechLLM,在中文等其他语言、真实嘈杂环境及更大偏置词表下的表现仍有待验证
50%