据报Meta Platforms(META)发布首款实时音频感知模型 支持多人多语言流式转写

金吾财讯
09/02

金吾财讯 | 据外媒报道,Meta Platforms(META)正式发布Muse Voice Transcribe,这是公司首款实时音频感知模型,开发者可通过Meta Model API调用该服务。

定价方面,服务费用为每1000分钟音频3美元,折合每小时0.18美元。该模型将流式语音识别、说话人分离、端点检测整合在一套流程内,可边说话边输出转写文本,无需等待音频完整录制完成。业务能力上,该模型能够区分同一段录音里20名以上不同发言者,自动识别语句停顿边界;训练覆盖70余种语言,发布时完成25种语言验证,支持时长超1小时音频,也适配句内、句间的多语言切换。开发者还可以通过语言、关键词、上下文偏置,提升特定术语、业务场景下识别精度。技术层面,Meta采用自适应延迟机制,动态权衡识别时延与准确率,针对每一个词汇判断需要接收多少音频再输出结果,兼顾实时响应效果与识别质量。

免责声明:投资有风险,本文并非投资建议,以上内容不应被视为任何金融产品的购买或出售要约、建议或邀请,作者或其他用户的任何相关讨论、评论或帖子也不应被视为此类内容。本文仅供一般参考,不考虑您的个人投资目标、财务状况或需求。TTM对信息的准确性和完整性不承担任何责任或保证,投资者应自行研究并在投资前寻求专业建议。

热议股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10