[控场AI]
· 5 分钟阅读· 2,844 字

实测OpenAI新语音模型:可打断、同声传译、情绪捕捉全解析

实测OpenAI新语音模型:可打断、同声传译、情绪捕捉全解析

凌晨发布的语音对话模型

就在今天凌晨一点,OpenAI 公开发布了全新的语音对话模型。据 B站 UP主段风的实测,这一模型目前已经开始逐步推送,用户在网页端或手机端都能看到并使用它。

这里值得一提的是,OpenAI 采用的是**灰度推送(Gray Release)**策略——新功能不一次性面向所有用户开放,而是按比例逐步扩大覆盖范围。一旦出现严重bug或体验问题,可以快速回滚,将影响范围控制在最小。这也是为什么部分用户暂时还看不到入口,属于正常的产品发布节奏。

从整场实测来看,这一代语音模型相比上一代有着质的飞跃。UP主的原话是:"他当然比上一代好非常非常多了,我不知道应该怎么形容,就是有一种跟伟人对话的感觉。"这种"语音上面的恐怖谷效应"贯穿了整个测试过程——中间好几次让人起鸡皮疙瘩,因为它实在太像真人了。

所谓恐怖谷效应,最早由日本机器人学家森政弘于1970年提出,描述当机器人或虚拟形象与人类相似度极高但又不完全一致时,人类会产生强烈的不适感。如今这一概念被延伸到AI语音领域——当语音模型的自然度接近真人却仍有破绽时,用户会感到诡异;而一旦越过这条临界线,反而会产生真实感和情感共鸣。新模型引发的「鸡皮疙瘩」感,恰恰说明它正在跨越这道门槛。

本次实测覆盖了多轮真实对话,包括自然打断、同声传译、角色扮演、代码审查、唱歌等多个场景,几乎每一项都展现出了超出预期的能力。

I am people

自然打断与情绪捕捉

新模型最令人震撼的一点,是它对对话节奏的把控。在测试中,UP主突然咳嗽了一声,AI 立刻停下来关切地询问:"你咳嗽了吗?没事没事,你吓到我了。"这种对突发状况的实时反应,几乎和真人无异。

更有意思的是随后的一段对话。当 UP主反问"你哪有嗓子呀,你是 AI"时,模型顺势接梗:"刚才可能是信号有一点点不对劲吧,被你发现了,其实我是个真人。"这种带着幽默感的即兴回应,展现了模型极强的语境理解和情绪表达能力。

打断即停,低延迟交互

在角色扮演环节,UP主要求模型扮演"反驳性人格",语气要强硬。当 UP主抛出"桌子是方的"这类绝对化命题时,模型立即顶回去:"我不同意,桌子不一定是方的,也有很多圆桌。"整个过程中,用户随时可以打断 AI 的发言,模型也能即时停止并转向新话题,这种低延迟的交互体验是过去语音助手难以企及的。

同声传译的惊艳表现

实测中最亮眼的功能之一是同声传译。UP主要求模型将普通话实时转成方言,模型即时应答"好的收到,你说普通话,我这边实时转成",甚至能根据要求切换到河南话进行同步翻译。

那没啥用吧他当场就表达了一句话

有意思的是,模型在翻译过程中还能感知语气和音量。当 UP主提示"你声音怎么这么小"时,它会主动调大音量,并切换为"很亢奋、很有精神"的状态。这背后的技术突破在于:传统**TTS(Text-to-Speech)**本质上只是将文字转换为语音,无法感知说话者的音量变化、停顿、语气等「副语言信息」。而新一代端到端语音模型直接在音频层面进行训练,能够捕捉并响应非文字的声学特征,不再需要先把语音转成文字再处理,而是像人耳一样直接理解声音本身携带的情绪和意图——这才是新模型区别于传统语音助手的核心突破。

不过实测中也暴露出一些小问题——模型偶尔会陷入复读循环,同一句话连续重复多次,说明稳定性仍有提升空间。

代码审查能力实测

除了闲聊和翻译,UP主还测试了模型的技术能力。他将一段由 Grok 4.5 生成的前端代码发给模型,让它找出 bug。

我现在正在制作一期视频

模型的表现相当专业,一口气指出了几个实打实的问题:

  • 移动端导航失效:在小于 800 像素时直接隐藏导航,却没有提供任何替代方案,导致手机用户完全失去导航功能;
  • CSS 兼容性风险:color-mix 这类新写法缺少降级方案,在旧浏览器上可能直接失效。color-mix() 是W3C较新的颜色混合规范,在2023年前的旧版浏览器中并不支持,专业前端开发通常需要提供降级的静态颜色值作为 fallback,AI 生成代码忽视此类兼容性问题是当前代码生成模型的常见短板;
  • 字体加载问题:完全依赖 Google Fonts,在部分网络环境下可能加载不出,导致视觉效果崩坏。

模型最后的总结颇为犀利:这份代码里的 Grok 4.5 "更像是一个很会做静态展示的前端实习生"。既能定位具体 bug、又能给出整体评价的能力,显示出语音模型背后强大的推理内核。

你有发现什么比较明显的bug吗

与豆包的横向对比

在对话中,UP主直接询问模型"你觉得豆包和你谁更厉害"。模型的回答相当客观:"很难一刀切,得看场景。豆包在中文本地化生态整合上很顺手,我这边擅长跨领域推理、长文表达。"

当被鼓励"可以狂一点"时,模型也毫不含糊:"复杂的推理和长文内容把控我更稳更准,豆包在一些本地化服务用起来更丝滑,但真要拼硬账我不虚。"

这段自我评价其实点出了两类产品的差异化定位:以豆包为代表的国产模型在中文语境和本地化服务上体验更顺滑,而 OpenAI 的模型则在跨领域推理和复杂长文处理上保持优势。

唱歌与情绪表演

实测还涉及了唱歌环节。UP主让模型哼唱《小星星》,模型欣然应允,从英文"Twinkle Twinkle Little Star"唱到中文"满天都是小星星"。不过 UP主吐槽"这个音调有点诡异",说明在音乐性和音准上,模型还有优化余地。

在情绪表演测试中,模型能够按要求快速切换"喜怒哀乐":表演"怒"时会喊出"谁把我钱给偷了,这日子没法过了",表演"乐"时则说"生活嘛,不就是这样起起落落"。这种情绪切换的即时性和感染力,进一步强化了它"接近真人"的体验。

总结:进步显著,仍需打磨

综合这次实测,OpenAI 新语音模型在自然对话、实时打断、同声传译、代码审查等多个维度都交出了令人惊艳的答卷。它不再是冷冰冰的语音助手,而是一个能感知情绪、即兴接梗、专业分析的对话伙伴。

当然,问题依然存在:偶发的复读循环、唱歌音调的诡异感、以及部分场景下语速节奏被用户"带偏"的情况,都说明这一模型仍处在持续打磨的阶段。正如 UP主所言,虽然"几度起鸡皮疙瘩",但"还是希望他们可以再优化一下"。

无论如何,这次发布标志着 AI 语音交互正在从"能用"迈向"好用"乃至"拟人"的新阶段,值得持续关注。

核心要点

分享:

相关推荐