实测OpenAI新语音模型:可打断、同声传译、情绪捕捉全解析

凌晨发布的语音对话模型
就在今天凌晨一点,OpenAI 公开发布了全新的语音对话模型。据 B站 UP主段风的实测,这一模型目前已经开始逐步推送,用户在网页端或手机端都能看到并使用它。
这里值得一提的是,OpenAI 采用的是**灰度推送(Gray Release)**策略——新功能不一次性面向所有用户开放,而是按比例逐步扩大覆盖范围。一旦出现严重bug或体验问题,可以快速回滚,将影响范围控制在最小。这也是为什么部分用户暂时还看不到入口,属于正常的产品发布节奏。
从整场实测来看,这一代语音模型相比上一代有着质的飞跃。UP主的原话是:"他当然比上一代好非常非常多了,我不知道应该怎么形容,就是有一种跟伟人对话的感觉。"这种"语音上面的恐怖谷效应"贯穿了整个测试过程——中间好几次让人起鸡皮疙瘩,因为它实在太像真人了。
所谓恐怖谷效应,最早由日本机器人学家森政弘于1970年提出,描述当机器人或虚拟形象与人类相似度极高但又不完全一致时,人类会产生强烈的不适感。如今这一概念被延伸到AI语音领域——当语音模型的自然度接近真人却仍有破绽时,用户会感到诡异;而一旦越过这条临界线,反而会产生真实感和情感共鸣。新模型引发的「鸡皮疙瘩」感,恰恰说明它正在跨越这道门槛。
本次实测覆盖了多轮真实对话,包括自然打断、同声传译、角色扮演、代码审查、唱歌等多个场景,几乎每一项都展现出了超出预期的能力。

自然打断与情绪捕捉
新模型最令人震撼的一点,是它对对话节奏的把控。在测试中,UP主突然咳嗽了一声,AI 立刻停下来关切地询问:"你咳嗽了吗?没事没事,你吓到我了。"这种对突发状况的实时反应,几乎和真人无异。
更有意思的是随后的一段对话。当 UP主反问"你哪有嗓子呀,你是 AI"时,模型顺势接梗:"刚才可能是信号有一点点不对劲吧,被你发现了,其实我是个真人。"这种带着幽默感的即兴回应,展现了模型极强的语境理解和情绪表达能力。
打断即停,低延迟交互
在角色扮演环节,UP主要求模型扮演"反驳性人格",语气要强硬。当 UP主抛出"桌子是方的"这类绝对化命题时,模型立即顶回去:"我不同意,桌子不一定是方的,也有很多圆桌。"整个过程中,用户随时可以打断 AI 的发言,模型也能即时停止并转向新话题,这种低延迟的交互体验是过去语音助手难以企及的。
同声传译的惊艳表现
实测中最亮眼的功能之一是同声传译。UP主要求模型将普通话实时转成方言,模型即时应答"好的收到,你说普通话,我这边实时转成",甚至能根据要求切换到河南话进行同步翻译。

有意思的是,模型在翻译过程中还能感知语气和音量。当 UP主提示"你声音怎么这么小"时,它会主动调大音量,并切换为"很亢奋、很有精神"的状态。这背后的技术突破在于:传统**TTS(Text-to-Speech)**本质上只是将文字转换为语音,无法感知说话者的音量变化、停顿、语气等「副语言信息」。而新一代端到端语音模型直接在音频层面进行训练,能够捕捉并响应非文字的声学特征,不再需要先把语音转成文字再处理,而是像人耳一样直接理解声音本身携带的情绪和意图——这才是新模型区别于传统语音助手的核心突破。
不过实测中也暴露出一些小问题——模型偶尔会陷入复读循环,同一句话连续重复多次,说明稳定性仍有提升空间。
代码审查能力实测
除了闲聊和翻译,UP主还测试了模型的技术能力。他将一段由 Grok 4.5 生成的前端代码发给模型,让它找出 bug。

模型的表现相当专业,一口气指出了几个实打实的问题:
- 移动端导航失效:在小于 800 像素时直接隐藏导航,却没有提供任何替代方案,导致手机用户完全失去导航功能;
- CSS 兼容性风险:
color-mix这类新写法缺少降级方案,在旧浏览器上可能直接失效。color-mix()是W3C较新的颜色混合规范,在2023年前的旧版浏览器中并不支持,专业前端开发通常需要提供降级的静态颜色值作为 fallback,AI 生成代码忽视此类兼容性问题是当前代码生成模型的常见短板; - 字体加载问题:完全依赖 Google Fonts,在部分网络环境下可能加载不出,导致视觉效果崩坏。
模型最后的总结颇为犀利:这份代码里的 Grok 4.5 "更像是一个很会做静态展示的前端实习生"。既能定位具体 bug、又能给出整体评价的能力,显示出语音模型背后强大的推理内核。

与豆包的横向对比
在对话中,UP主直接询问模型"你觉得豆包和你谁更厉害"。模型的回答相当客观:"很难一刀切,得看场景。豆包在中文本地化生态整合上很顺手,我这边擅长跨领域推理、长文表达。"
当被鼓励"可以狂一点"时,模型也毫不含糊:"复杂的推理和长文内容把控我更稳更准,豆包在一些本地化服务用起来更丝滑,但真要拼硬账我不虚。"
这段自我评价其实点出了两类产品的差异化定位:以豆包为代表的国产模型在中文语境和本地化服务上体验更顺滑,而 OpenAI 的模型则在跨领域推理和复杂长文处理上保持优势。
唱歌与情绪表演
实测还涉及了唱歌环节。UP主让模型哼唱《小星星》,模型欣然应允,从英文"Twinkle Twinkle Little Star"唱到中文"满天都是小星星"。不过 UP主吐槽"这个音调有点诡异",说明在音乐性和音准上,模型还有优化余地。
在情绪表演测试中,模型能够按要求快速切换"喜怒哀乐":表演"怒"时会喊出"谁把我钱给偷了,这日子没法过了",表演"乐"时则说"生活嘛,不就是这样起起落落"。这种情绪切换的即时性和感染力,进一步强化了它"接近真人"的体验。
总结:进步显著,仍需打磨
综合这次实测,OpenAI 新语音模型在自然对话、实时打断、同声传译、代码审查等多个维度都交出了令人惊艳的答卷。它不再是冷冰冰的语音助手,而是一个能感知情绪、即兴接梗、专业分析的对话伙伴。
当然,问题依然存在:偶发的复读循环、唱歌音调的诡异感、以及部分场景下语速节奏被用户"带偏"的情况,都说明这一模型仍处在持续打磨的阶段。正如 UP主所言,虽然"几度起鸡皮疙瘩",但"还是希望他们可以再优化一下"。
无论如何,这次发布标志着 AI 语音交互正在从"能用"迈向"好用"乃至"拟人"的新阶段,值得持续关注。
核心要点
相关推荐

零基础用n8n搭建首个AI智能体:免费邮件助手实战
用开源工具n8n零基础搭建第一个AI智能体,打造自动分拣邮件的收件箱助手。本文详解五步搭建流程、安全缰绳规则、模型选择与每月10美元以内的成本账。

n8n + Ollama 本地化AI自动化:PDF摘要不上云实战
手把手教你用 n8n 和 Ollama 搭建完全本地化的AI自动化流程:PDF丢进文件夹自动生成摘要,不上云、无API Key。涵盖Docker安装、Llama 3.2模型配置、六节点工作流及四大常见踩坑修复。

n8n + AI自动化:90天构建智能工作流的分层路径
一篇基于 YouTube 教程的 n8n AI 自动化实战指南:从 JSON、IF 节点等确定性逻辑入手,再到 API、Webhook 与错误处理,最终在稳固框架上安全部署 AI Agent,配套90天分层学习路线图。