智通財經APP訊,雲知聲(09678)發布公告,近日,公司全面完成U2-ASR與U2-TTS的能力升級,持續加強多模態大模型能力,在語音大模型領域實現從「百種方言」的本土深耕到「全球多語種」的廣闊拓展,進一步夯實了全球化語音交互基礎設施能力,為跨境出海、具身智能及Agent交互等場景提供高效、低門檻的技術支撐。
本次升級中,U2-ASR新增13種國際語言識別能力,覆蓋歐洲、東南亞、中東及拉美等重點出海市場;U2-TTS新增8種東南亞語言語音合成能力。至此,U2語音大模型已支持超100種中國方言及超15種國際語言,企業只需接入一個模型、一套接口,即可處理不同語言的音頻內容,大幅降低多語種語音業務的開發、部署和維護門檻。
在統一評測口徑下,U2-ASR與業界標杆模型對比表現卓越:113種語言平均字錯率(CER)僅為6.58%,在不傳入語種標籤的真實業務場景中,憑藉自動語種識別與閉集路由能力依然保持高準確率,有效避免語種誤判。與此同時,在 ChinaVoices Challenge 2026中文多方言語音識別挑戰賽中,U2-ASR以CER 9.235% 獲得限定數據方案第1名、開放數據方案第2名的雙榜領先成績,進一步驗證了其語音識別技術的領先性。U2-TTS在可懂度與自然度主觀評測中綜合表現領先業界主流模型,並採用流式神經網絡聲學模型實現逐chunk實時輸出24kHz高保真語音,首包延遲顯着降低,滿足實時語音對話等強時效交互需求。
此次升級使U2-ASR與U2-TTS能夠無縫協同,為企業構建面向智能體(Agent)的完整多語種語音交互鏈路,語音技術正逐步成為全球化業務的核心交互基礎設施。目前,升級後的U2-ASR與U2-TTS已全量上線公司TokenHub大模型服務平台並開放標準API。公司將持續踐行「智能向善」理念,以科技之力打破語言壁壘,推動AI技術普惠共享,使不同國家、不同發展階段的地區均能平等享受 AGI時代的技術紅利。