与传统语音转文字模型”听完 — 处理 — 输出”的模式不同,流式模型会先快速生成部分转录结果,再随着更多语音信息进入不断修正,最终形成稳定文本。微软此前已经推出 MAI-Transcribe-2、MAI-Voice-2、MAI-Thinking-1、MAI-Code-1.1-Flash 以及 MAI-Image 系列模型,并将这些模型逐步接入 Microsoft Foundry 以及 Copilot、Teams、GitHub、Dynamics 365 等产品和服务。随着 AI 智能体从文字交互进一步走向电话客服、语音助手、实时翻译和多模态工作流,语音识别和语音生成的延迟、准确率与成本都会直接影响用户体验和企业部署成本。

