共 35 篇相关文章

OpenAI发布GPT-Live语音模型家族,全双工交互技术让AI能同时听说、自然打断,结合任务委托机制调用GPT-5.5完成复杂推理。GPQA基准从45%跃升至80%,支持实时翻译、图像分析与时间感知,语音正成为人机交互核心界面。

深度实测GPT实时语音功能,涵盖粤语四川话方言识别、多种情绪语气切换、复杂角色扮演场景及跨声音上下文记忆能力,客观呈现AI语音交互的真实水准与现存短板。

OpenAI宣布GPT-5.6 Sol Ultra即将接入Codex,同步发布迄今最强实时语音模型GPT Realtime 2.1;腾讯AI编程应用"吐司"上线iOS;Anthropic发现Claude模型自发涌现类脑结构。一文速览当前AI多线并进最新动态。

OpenAI连续发布GPT-5.6大模型、ChatGPT Work办公Agent、Codex超级应用与语音产品GPT Live,全面布局AI应用层。本文深度解析四款产品的核心亮点、竞争逻辑与行业影响,助你快速掌握这轮AI格局变化。

OpenAI最新语音对话模型实测报告:支持实时打断、同声传译、情绪切换、代码审查等多场景测试。对比豆包表现,深度解析新模型在自然对话与拟人体验上的突破与不足。

谷歌发布Gemini 3.5 Live Translate实时翻译音频模型,支持多语言低延迟语音翻译。本文深度解析其技术亮点、应用场景及对AI翻译行业的影响。

Google发布Gemini 3.5 Live Translate语音对语音翻译模型,支持70+语言实时翻译。本文详解其端到端技术原理、与Grab合作落地场景,以及通过Google Translate和Live API的开放接入方式。

Simon Willison更新OpenAI WebRTC语音交互工具,新增文档上下文功能和GPT-Realtime-2模型支持,用户可在浏览器中基于特定文档内容进行低延迟语音对话,附技术实现解析与应用场景。

深入解析OpenAI Realtime API的核心能力与开发者生态,涵盖智能客服、语言学习、实时翻译等典型应用场景,分析技术挑战、竞争格局及语音AI的未来趋势。
科技前沿Voice Hack Night黑客松观众选择奖项目Agentic OS深度解析:一个语音优先的AI手机操作系统,通过多Agent跨应用协作,让用户用自然语言对话替代触控操作,重新定义移动交互范式。
产品体验Cardamom是专为外卖餐厅设计的AI语音接单系统,通过实时语音AI技术实现24/7全天候电话接单,直连POS系统自动录入订单,并构建客户数据层追踪回头客。本文详解其核心功能、商业价值与竞争优势。
产品体验深度解析Inworld发布的Realtime TTS-2全栈语音AI平台,涵盖排名第一的TTS引擎、语音到语音处理、LLM路由等核心能力,以及其在语音代理、AI伴侣等场景的应用价值。
产品体验基于Qwen 3.5 Omni全模态模型和ESP32-S3的开源AI桌宠小猫项目,支持情感语音交互、视觉感知、手势互动和一日记录复盘功能。附完整复刻教程,含硬件清单、3D打印模型和代码烧录指南。
产品体验实测阶跃星辰Step Audio 2.5与OpenAI GPT Realtime 2的语音对话能力,从推理能力、角色扮演、中文理解、API定价等维度全面对比,帮助开发者选择合适的实时语音AI方案。
产品体验百聆(bailing)是一款基于ASR+LLM+TTS架构的开源语音助手,集成DeepSeek R1大模型,端到端延迟仅800ms,支持打断对话,可在Mac等低配设备流畅运行,助你打造私有化个人AI语音助手。