共 37 篇相关文章

深入分析自托管ASR开源模型与Google等云端语音识别API的成本差异、可靠性对比及盈亏平衡点计算,提供Whisper、IBM Granite等方案的实用选型建议,帮助团队做出最优技术决策。

深入解析谷歌最新发布的Gemini 3.5 Transcribe语音转录模型,了解其智能转录、精准识别的核心能力,以及在会议记录、字幕生成、客服质检等场景的应用价值与竞争优势。

深入解析Google Gemini 3.5 Transcribe的智能语音转写能力,探讨其上下文纠错、专业术语识别、口语整理等核心特性,以及在会议记录、内容创作、客服合规等场景的应用前景。

探索语音驱动的AI谋杀悬疑推理游戏,玩家通过语音实时审讯AI嫌疑人破案。深度解析背后的语音识别、大语言模型角色扮演与TTS技术架构,以及AI游戏交互的新范式。

Gotcha是全球首个安卓端AI语音副驾开源项目,支持端侧运行保护隐私,内置100+原生设备工具,通过Samosa AIR引擎实现语音指令到设备操作的完整闭环,免费开源可定制扩展。

VoiceGecko 是一款开源桌面语音转文字工具,完全本地运行,无需云端处理。支持快捷键触发、即时转录,兼顾隐私保护与低延迟体验,适合开发者、AI用户和内容创作者提升输入效率。

MeetStream AI提供统一API对接Zoom、Google Meet和Microsoft Teams,内置语音基础设施让AI Agent实时参与会议。深度解析其技术架构、应用场景及面临的挑战。

HyNote for Mac是一款完全本地运行的免费会议转录工具,无需云端上传、无机器人打扰,支持Zoom、Google Meet等主流平台。深度解析其隐私保护架构、使用体验及竞品对比。

Deepmark是一款基于AI语义搜索的书签管理工具,支持聚合浏览器书签、X收藏、Instagram保存等多平台内容,通过多模态解析实现按内容而非标题搜索。本文详细解析其工作原理、性能表现及MCP智能体集成能力。

深入解析语音智能体三种主流架构(三明治、原生实时、混合),对比STT+Agent+TTS方案在智能体能力与实时性之间的权衡,帮助企业团队选择最合适的语音AI落地路径。

超过18万条AI会议录音在无防护状态下被公开暴露,涉及企业商业机密与多方隐私。本文深入分析泄露的技术根源、AI会议录音的敏感性,并为企业用户和AI开发者提供数据安全防护建议。

SpeakoFlow是一款开源本地语音助手,支持全局语音输入、屏幕内容理解和实时翻译。采用MIT协议,语音转文字完全本地运行,保护隐私数据不上传云端,支持Windows、macOS和Linux。

VoiceOS App Store是一款住在Mac刘海里的语音原生应用商店,用户只需一句话即可生成定制化应用并通过链接分享。深度解析其意图驱动的构建方式、无摩擦分发机制及语音原生应用的未来前景。

深入解析LiveKit Agents开源框架,了解如何利用STT、LLM、TTS模块构建实时语音AI智能体。涵盖核心架构、多模型插件生态、生产部署能力及智能客服、虚拟助理等应用场景。

Bolcho AI是一款专注印度市场的语音AI平台,支持印地语、泰米尔语等多种本地语言,提供超低延迟、电话系统集成和灵活模型接入能力,帮助企业快速部署本地化AI客服与销售智能体。

Capptivo是一款免费开源的屏幕录制与演示编辑器,支持macOS、Windows和Linux三平台,提供光标跟随缩放、本地字幕烧录等功能,无需账号和订阅,本地优先保护隐私。

深度解析Laxis AI会议记录工具:无需机器人即可录制会议,支持100+语言实时翻译,语音听写比打字快4倍。了解其核心功能、竞品对比与实际使用价值。

Qwen Scribe是一款专为Apple Silicon优化的本地语音转写与听写工具,基于通义千问模型实现完全离线运行。本文详解其技术特点、隐私优势及与Whisper等同类工具的对比。