共 10 篇相关文章

冰岛语音仿真公司Treble完成1800万美元融资,其平台服务于语音AI模型开发者、AI可穿戴设备及机器人公司。本文解析语音仿真技术价值与融资背后的行业信号。

谷歌推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,官方称为迄今最先进的 Gemini 音频模型,主打自然实时语音对话,并引入延展思考能力应对复杂问题。本文解析两款模型定位、语音对话竞争与市场反馈。

OpenAI 将全双工语音模型 GPT-Live-1 引入 API,支持自然打断、抗背景噪音,采用前端对话+后端推理架构,前端定价每分钟 0.05 美元,面向规模化对话式语音应用。

谷歌发布 Gemini 3.8 Live 与 Extended Thinking 两款语音对语音模型,形态类似 OpenAI GPT-Live。本文实测其浏览器语音对话体验,并解析基于 WebSocket 与 Web Audio API 的零依赖技术实现。

谷歌发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时语音对话模型,支持并行推理、后台任务执行、97 种语言实时切换与视觉理解,并在语音质量与智能体任务基准中领先。本文解析其核心能力与生态布局。
科技前沿OpenAI举办Voice Hack Night黑客马拉松,参赛团队6小时内构建实时语音代理项目,4个项目进入决赛。深度解析实时语音AI的技术挑战、落地场景与开发者生态趋势。
产品体验深度解析Inworld发布的Realtime TTS-2全栈语音AI平台,涵盖排名第一的TTS引擎、语音到语音处理、LLM路由等核心能力,以及其在语音代理、AI伴侣等场景的应用价值。
产品体验Dogra是一款开源自托管语音AI平台,提供可视化工作流构建器、多服务商自由切换和完整调用追踪能力。对比VAPI、Bland等托管平台,Dogra帮助开发者大幅降低语音Agent成本,摆脱供应商锁定,实现完全可控的语音AI部署。
科技前沿OpenAI将于5月27日在旧金山举办实时语音Demo展示活动,面向开发者征集基于Realtime Voice模型的创意项目。本文详解活动评选标准、奖励机制及语音AI开发者生态的战略意义。
科技前沿阿里开源Qwen3.6 35B模型,256专家MoE架构仅需3B激活参数,SWE Bench成绩逼近Claude Opus。xAI发布Voice Cloning API支持28种语言,NVIDIA开源OpenShell安全沙箱,Sam Altman表态模型智力优先。