Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写

科技媒体9to5Mac 发布博文,报道称 Meta 公司推出 Muse Voice Transcribe, 这是其首个实时音频感知模型。 开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元 (现汇率约合 20.2 元人民币) ,等同每小时 0.18 美元 (现汇率约合 1.2 元人民币) 。 该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。

圈主 管理员

热门评论
:
该帖子评论已关闭
图片审查中...
编辑答案: 我的回答: 最多上传一张图片和一个附件
x
x