共 10 篇相关文章

ElevenLabs推出面向Claude的MCP集成方案,开发者可通过自然语言对话创建、配置和管理语音智能体,无需切换平台。本文解析MCP协议如何简化语音AI工作流及其对行业的深远影响。

深入解析语音智能体三种主流架构(三明治、原生实时、混合),对比STT+Agent+TTS方案在智能体能力与实时性之间的权衡,帮助企业团队选择最合适的语音AI落地路径。

Bolcho AI是一款专注印度市场的语音AI平台,支持印地语、泰米尔语等多种本地语言,提供超低延迟、电话系统集成和灵活模型接入能力,帮助企业快速部署本地化AI客服与销售智能体。

LangChain密集发布四项核心功能:OpenWiki自动生成代码库文档、两套语音智能体教程、Harbor长时评估集成,以及deepagents可编程子智能体。本文逐一拆解每项功能的技术原理与应用场景,助力开发者快速掌握智能体全链路开发能力。

Dograh是一款完全开源的语音AI智能体平台,提供可视化流程构建、30+模型集成、本地部署、电话通信及人工转接等功能,支持一条命令自托管,是VAPI的自由替代方案。

深入解析LiveKit Agents开源框架,了解如何利用STT、LLM、TTS模块构建实时语音AI智能体。涵盖核心架构、多模型插件生态、生产部署能力及智能客服、虚拟助理等应用场景。

深入解析HuggingFace speech-to-speech开源项目,涵盖VAD、STT、LLM、TTS四大模块的模块化架构设计,以及本地部署在数据隐私、成本控制和低延迟方面的核心优势,助力开发者构建自主可控的语音智能体。

OpenAI Codex语音模式迎来关键升级,支持后台常驻运行和永不中断的语音编程体验。本文深入解析新版语音模式的工作流变化、环境编程智能体的核心价值,以及语音编程对开发者的现实意义。

OpenAI发布GPT-Live全双工语音模型,支持实时打断、前后台算力分级调度与动态UI渲染,全面超越Siri,直指操作系统级语音交互入口。解析四大核心能力与行业格局影响。

详解如何用Claude Code和AssemblyAI语音智能体API,一个下午从零搭建具备语音识别、对话理解和日历预约功能的Voice Agent,含完整开发流程、成本对比和实际演示效果。