[控场AI]

#语音识别

共 20 篇相关文章

Angebotsmeister:说句话就能生成报价单的德国工匠神器
·4 分钟

Angebotsmeister:说句话就能生成报价单的德国工匠神器

Angebotsmeister 是一款面向德国手工业者的语音报价工具,工匠口述即可生成结构化报价单、透明价格来源与在线可接受的 PDF,并支持一键开票。免费起步,登上 Product Hunt 当日第15名。

阅读全文 →
语音识别远未解决:Mistral音频研究负责人深度解析
·10 分钟

语音识别远未解决:Mistral音频研究负责人深度解析

Mistral AI音频研究负责人Pavan Kumar Reddy深度解析语音识别为何远未解决:从Voxtral模型架构、连续隐变量生成、流式与批量权衡、说话人分离难题到DPO修复幻觉,以及语音技术在真实企业场景的落地短板。

阅读全文 →
语言区分能力提升多语言语音模型的语言学习表现
·4 分钟

语言区分能力提升多语言语音模型的语言学习表现

研究发现,强化多语言自监督语音模型的语言区分能力,可缩小甚至消除其与单语言模型的性能差距,同时保留跨语言共享优势。基于英语/法语HuBERT实验,验证了辅助语言任务等干预手段的有效性。

阅读全文 →
微调NVIDIA Nemotron适配沙特阿拉伯方言:低资源语言的落地路径
·4 分钟

微调NVIDIA Nemotron适配沙特阿拉伯方言:低资源语言的落地路径

NVIDIA分享如何微调Nemotron语音模型以识别沙特阿拉伯方言,并提炼出一套可迁移到其他低资源语言的通用路径,为全球语音AI本地化提供参考范例。

阅读全文 →
TutlAit v1:摩洛哥塔马齐格特语语音数据集的众包实践
·5 分钟

TutlAit v1:摩洛哥塔马齐格特语语音数据集的众包实践

TutlAit v1 是一个众包构建的摩洛哥塔马齐格特语语音数据集,包含约20.9小时音频、阿拉伯语转写和地区口音标签,可用于语音识别、语音翻译和口音识别,为低资源语言技术提供基础素材。

阅读全文 →
AI语音分析自动评估运动神经元病患者语言流畅指数
·5 分钟

AI语音分析自动评估运动神经元病患者语言流畅指数

一项arXiv研究提出利用WhisperX语音识别与Silero停顿建模自动估算运动神经元病患者的语言流畅指数(VFI),临床启发特征表现优异,P-words任务R²达0.9,展示医疗语音AI的应用潜力。

阅读全文 →
Oído开源语音识别:5美元单片机跑赢Whisper-tiny
·5 分钟

Oído开源语音识别:5美元单片机跑赢Whisper-tiny

开源项目Oído在5美元的ESP32-S3微控制器上运行语音识别,采用13M参数的NVIDIA Conformer-CTC模型,LibriSpeech与噪声环境下的词错误率均优于笔记本上的Whisper-tiny,为边缘离线语音AI提供了低成本新方案。

阅读全文 →
噪声警务音频难题:预训练ASR伪标签方法的机遇与边界
·5 分钟

噪声警务音频难题:预训练ASR伪标签方法的机遇与边界

最新 arXiv 论文系统评估伪标签方法在噪声警务音频(BPC)上适配 Whisper、Qwen3-ASR 的效果,揭示内部置信度指标失灵,并提出 LLM-as-a-judge 过滤与跨模型伪标签两大新范式。

阅读全文 →
PTC-Bias:用音素级时间竞争提升语音大模型的稀有词识别
·5 分钟

PTC-Bias:用音素级时间竞争提升语音大模型的稀有词识别

arXiv 最新论文提出 PTC-Bias 框架,通过音素级时间竞争实现语音大模型的两阶段上下文偏置。在 LibriSpeech 上,2000 词偏置列表下 B-WER 相对 CTC-Filter 降低超 23%,且无需额外模型前向计算。

阅读全文 →
半监督联邦语音识别实用方案:在线伪标签与服务端更新稳定化
·5 分钟

半监督联邦语音识别实用方案:在线伪标签与服务端更新稳定化

本文解析半监督联邦学习在自动语音识别(ASR)中的实用方案,重点探讨在线伪标签与服务端更新稳定化两大设计维度,剖析ASR为何脆弱以及如何缩小与全监督联邦学习的性能差距。

阅读全文 →
传音的说话人归属多语种ASR系统:MLC-SLM 2026挑战赛亚军方案解析
·6 分钟

传音的说话人归属多语种ASR系统:MLC-SLM 2026挑战赛亚军方案解析

传音语音团队在MLC-SLM 2026挑战赛提交的说话人归属多语种ASR系统解析。基于DiariZen说话人日志、Qwen3-Omni多语种ASR与CTC对齐的级联框架,以15.41%的tcpMER排名第二。

阅读全文 →
阿拉伯语流式语音识别频繁断句?技术解析与应对方案
·4 分钟

阿拉伯语流式语音识别频繁断句?技术解析与应对方案

阿拉伯语流式语音识别(Streaming STT)频繁半句断句,而英语西班牙语正常?本文解析端点检测原理、方言与MSA训练数据不匹配等根源,并给出延迟与准确率权衡的实用应对方案。

阅读全文 →
Canto语音模型:为真实世界场景打造的语音AI
·3 分钟

Canto语音模型:为真实世界场景打造的语音AI

Canto是一款主打真实世界应用场景的语音AI模型,强调在噪声、口音等复杂环境下的鲁棒性。本文解析其定位、语音AI落地挑战及开发者评估要点。

阅读全文 →
AI Agent 流水线中的劣质音频处理:架构策略与实战指南
·6 分钟

AI Agent 流水线中的劣质音频处理:架构策略与实战指南

面对回声、含混、噪声严重的劣质录音,AI Agent 语音流水线该如何设计?本文梳理音频预处理、STT 置信度护栏、幻觉检测与多 Agent 交叉验证等实战架构策略,帮你避免转录幻觉与上下文丢失。

阅读全文 →
用声学掩蔽量化辅音对词语可懂度的贡献
·4 分钟

用声学掩蔽量化辅音对词语可懂度的贡献

arXiv 新论文提出用声学掩蔽与 ASR 模型量化辅音对词语可懂度的贡献,定义掩蔽诱导误识率 MMR,覆盖英语等四种语言和三类 ASR 架构,发现辅音贡献因语言而异。

阅读全文 →
GetThis测评:语音截图自动生成任务清单的AI效率工具
产品体验
·5 分钟

GetThis测评:语音截图自动生成任务清单的AI效率工具

深度体验GetThis这款AI任务管理工具,支持语音、文字、截图三种方式自动生成和分类任务清单。分析其核心功能、使用场景及与Todoist等传统工具的差异化竞争优势。

阅读全文 →
Qwen3.5-Omni发布:215项任务SOTA,阿里全模态大模型硬刚Gemini
科技前沿
·3 分钟

Qwen3.5-Omni发布:215项任务SOTA,阿里全模态大模型硬刚Gemini

阿里发布Qwen3.5-Omni全模态大模型,基于1亿小时音视频数据原生多模态预训练,215项任务拿下SOTA,多项指标超越Gemini 3.1 Pro。支持音视频Web Coding、长音频分析、113种语言语音识别等能力。

阅读全文 →
Whisper本地部署教程:手把手搭建免费语音转文字工具
教程攻略
·12 分钟

Whisper本地部署教程:手把手搭建免费语音转文字工具

详细图文教程教你在本地部署OpenAI Whisper语音识别工具,涵盖Conda环境配置、PyTorch安装、模型选择到实际转录操作全流程,支持近百种语言,免费生成SRT字幕文件。

阅读全文 →