刚刚,中国语音AI连拿多项全球第一

新智元
Sep 15

地铁急刹,金属尖叫,广播响起请乘客注意扶稳,人群骚动、孩子哭声、对讲机杂音一层层涌上来···

你甚至能感觉到车厢在晃。

这不是电影原声带。整段声音是用一句 prompt,AI 一次性生成的。

再来听一首歌。先是一段清唱,没有伴奏,就是一个人对着麦克风干唱:

然后,AI 接手了。一句提示词——

一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫

模型直接在这段清唱的基础上,补齐了编曲、和声、节奏和完整制作:

从一段干巴巴的清唱,到一首有呼吸感的完整歌曲。你能听出来这是 AI 做的吗?

说实话,我第一次听的时候也没分出来。

音频大模型,开始比体系了

过去两年,语音 AI 赛道非常热闹。

Suno 两天前刚发布了 v6 系列,OpenAI 的 GPT-Realtime-2 今年把实时语音推理能力拉到了 GPT-5 级别,Google 在 I/O 上把 Gemini Live 推到 70+ 语言的流式翻译。

但有一个现象值得注意:几乎所有玩家,都在比单项。

做语音合成的比谁说话更像真人,做语音识别的比谁听写更准,做音乐的比谁生成的歌更好听,做实时对话的比谁反应更快。

然而现实世界里的语音需求,从来不是一个孤立的点。

一条短视频的声音制作,需要角色配音、环境音效、背景音乐,可能还需要先把素材里的人声转成文字做理解。

Voice Agent 要跑起来,语音识别、语音生成、实时交互、推理、工具调用得同时在线。一个音乐创作者做一首歌,可能先有一段清唱,需要 AI 补上编曲、和声和制作。

这些场景对应的不是一个模型,而是一组能力。

这正是行业正在发生的一个结构性变化:当单点能力逐渐拉平,决定竞争力上限的,变成了谁能把理解、生成、交互和创作连成一套完整的体系。

9 月 15 日,阶跃星辰一口气放出了 StepAudio 3 系列五款模型:StepAudio 3 TTS(语音生成)、StepAudio 3 Gen(完整音频生成)、StepAudio 3 Realtime(实时语音交互)、StepAudio 3 ASR(语音识别)和 StepAudio 3 Music(音乐创作)。

五条产品线,覆盖听、说、理解、交互、创作全链路。这在国内音频大模型领域,是第一家以完整矩阵形态同时推出的。

它反映出阶跃对语音 AI 竞争走向的一个判断:单项能力竞赛的窗口期正在关闭,全栈体系化能力开始成为真正的壁垒。

不过话说回来,全栈的前提是每一条腿都得站得住。

这一点,第三方榜单先给了答案——三个全球第一

Artificial Analysis Conversational Dynamics 榜单,StepAudio 3 Realtime 以 98.9% 的综合得分,全球第一。

这个榜单测的是对话节奏感:什么时候该接话,什么时候该等你说完,用户突然插一句是想打断还是只在附和。这恰恰是实时语音里最像人也最难的部分——不是听懂和回答,而是知道该不该现在开口。

Artificial Analysis Speech Reasoning 榜单,StepAudio 3 Realtime 以 99.7% 的语音推理准确率,位列全球第一。

这张榜考的是模型能不能直接听懂音频并完成复杂推理任务,而不是先老老实实转成文字再去想。它是业内评估原生语音模型最权威的第三方基准之一。

Artificial Analysis 非流式语音识别准确性榜单,StepAudio 3 ASRWER(词错误率)仅 1.7%,并列全球第一。

WER 这个指标很朴素:每转写 100 个词错几个。1.7% 意味着差不多 60 个词才错一个,已经接近专业速记员的水准。

榜单说完了。接下来的部分,我们不看分数,只看这些模型在真实场景里到底是什么表现。

像人一样交流

语音模型的基础能力正在快速成熟。

但识别准确、声音自然、响应够快这些单点指标,已经不足以构成完整体验。

真正拉开差距的,是模型能否接近真实人类交流的状态:听懂语境、自然表达,并在持续对话中完成理解、回应和行动。

StepAudio 3 TTS:从声音自然到表达自然

市面上大多数 TTS 模型已经能把声音做得很像真人了。

但仔细听会发现,它们像的是播音员。字正腔圆,完美得不像在说话,更像在朗读。

真实的人类交流不是这样的。是呃、是就是那个、是说到一半改口、是突然笑出来又赶紧收住。

来听一段 StepAudio 3 TTS 生成的语音:

我最近就特别纠结,就是要不要换工作这个事。呃,现在这家吧,钱少,但是离家近嘛,走路十分钟。新的那个 offer 呢,给得多,多个,多个四千吧大概,但通勤单程要一个半小时。我妈说钱重要,我朋友说命重要,我就,唉,怎么说呢,天天睡前想这事,越想越睡不着。

注意那些细节:就特别纠结里带着微妙的叹气,多个,多个四千的口语化重复完全自然,说到命重要时语气微微上扬,紧接着的唉里满是无奈。

这些不是预设的情绪标签,而是模型根据语义自主判断出来的表达方式。

再来一段:

你不老说通勤无聊吗,我给你安利个播客,就,讲那种,呃,讲历史八卦的。主播俩人特逗,一集大概,嗯,一个小时吧,正好我来回路上听。我这两个月,就,就靠它撑着了。你搜那个名字我回头发你,反正免费的。

这段语音里的就,就靠它撑着了,两个就之间有一个几乎无意识的停顿,完全是人在组织语言时的自然节奏。

目前行业里大部分 TTS 模型处理这类口语化表达时,要么直接忽略重复词,要么机械地念两遍,很难做到这种“不完美但真实”的语感还原。

从技术层面看,StepAudio 3 TTS 在音色基底、语调层次、节奏律动和气口停顿上全面贴合自然口语模式,并能还原笑声、迟疑、结巴、改口等副语言特征。

前代 StepAudio 2.5 TTS 已经在全球权威的 Artificial Analysis Speech Arena 拿下国产第一、全球前三。

StepAudio 3 TTS 在这个基底上再往前推了一步,把音色像不像转移到了说话方式像不像。

StepAudio 3 ASR:从听清到听懂

语音识别看起来已经很成熟了。但 AI听清和听懂之间,隔着一条鸿沟。

你说骁龙8至尊版,它给你转成小龙八至尊版。你说张靓颖,它给你写成张亮影。

问题的根源在于,传统 ASR 只依赖声学信息——它在意听到了什么音,而不是说的是什么意思。

StepAudio 3 ASR 的思路是把高精度声学建模和大语言模型的语境理解结合在一起。

识别语音时,模型不只做音-字对应,还会调用语言模型的知识和推理能力辅助判断:根据上下文,这个音更可能是哪个词?

这个方向并非阶跃独创,业内多家都在探索 ASR 与 LLM 的融合。

但 StepAudio 3 ASR 的覆盖面值得关注:方言、口音、中英混说、低声耳语、快语速连读、甚至唱歌和有背景音乐的场景都能处理。长音频支持也不是简单的切片-转写-拼接,而是端到端的完整理解,避免上下文断裂。

这直接关系到会议纪要、视频字幕、智能客服、车载交互、医疗记录等一系列场景的实际可用性。

比如,我们先用 StepAudio 3 Gen 出一段机场的背景音。

再拿去让 StepAudio 3 ASR 去听。这其实是拿 StepAudio 3 自己考自己。

Gen 这边,广播腔拿捏得很准:有那种通过航站楼喇叭传出来的压缩感和轻微失真,不是干干净净的棚里录音。

ASR 这边更见功夫,全程 40 秒的音频里,MU 5127、C17、C31、18 点 45 分这些字母数字混排的信息一个没错。

机场广播的登机口和航班号恰恰是最容易听错的部分,C17 和 C31 又是在同一句话里对照出现,转错一个字乘客就跑错门了。

AI 生成的声音能被 AI 准确听回来,这本身就说明两端的质量都立得住。

当 ASR 从转写工具进化为语音理解基础设施,它的产业价值就完全不同了。

StepAudio 3 Realtime:从能打断到边聊边想边做

全双工、打断、低延迟——2026 年,这些已经是实时语音的桌面赌注。

真正拉开差距的,是另一个问题:模型在一场持续对话中,能不能同时处理理解、回应、推理和行动?

举个例子。

你跟一个 Voice Agent 说:帮我查一下明天北京飞上海的航班,要下午的,最好是东航。

一个只做了全双工和打断的模型,可能先转文字再调 API,中间一段尴尬的沉默。更糟的情况是,你开始追问时它还没查完,系统直接卡住。

StepAudio 3 Realtime 的做法是推理与语音生成并行,工具调用和长任务异步执行。不阻塞当前对话,任务完成后自然接回上下文。同时它能感知语气、情绪、副语言和环境声音,不只是听你说了什么,还在理解你怎么说的。

我们来个实测。

一分钟里,连着改了四次口——坐飞机、别太晚到、时间从周五晚放宽到周六上午、直达。

每一次都是掐在 AI 刚开口的当口打断的。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10