[控场AI]
模型Full-Duplex Voice Activity Detection

FD-VAD

一种面向全双工语音交互的语义端点检测方法,将端点检测建模为因果音频-语言推理任务,结合冻结语音编码器、轻量级模态适配器和参数高效适配的语言模型,无需ASR即可实现流式语义轮次判断

时间轴 (近 90 天)

9月30日

FD-VAD 是一种将语义端点检测建模为因果音频-语言推理任务的方法,直接从有限的因果音频窗口映射到继续/停止的二元决策,无需 ASR 介入

待验证50%
9月30日

FD-VAD 的架构由冻结的语音编码器、轻量级模态适配器和参数高效适配的语言模型组成

待验证50%
9月30日

FD-VAD 采用专门为流式推理设计的末块训练目标(last-chunk training objective)

待验证50%
9月30日

FD-VAD 采用置信度门控端点提交机制,通过置信度阈值平衡打断风险与延迟

待验证50%
9月30日

FD-VAD 使用边界聚焦的困难负样本采样,在训练时强化模型对模糊轮次边界的判别能力

待验证50%
9月30日

在 TurnBench 开发集的零样本设定下,FD-VAD 在误报率 FP≤0.10 约束下取得最高 EOT 召回率 0.853

待验证50%
9月30日

FD-VAD 在域内和对话场景两类评测中超越了多个流式与非流式语义轮次分类器基线

待验证50%
9月30日

FD-VAD 的 ASR-free 架构对语音助手、实时同传、客服机器人等全双工交互场景可带来更短响应链路和更低延迟

待验证50%

全部知识事实 (8)

来源文章