Qwen-Audio-3.1 系列一口气放出五款模型,从识别、合成到实时交互再到音频创作与理解,凑齐了一套覆盖”理解 — 生成 — 交互 — 创作”的完整音频能力矩阵,顺手还把全线价格狠狠往下拽了一把:TTS 直降约 70%,Realtime 降幅约 85%,ASR 更是砍掉 95%。Qwen-Audio-3.1-Realtime 正和 Qoder、千问办公等 Agent,以及 QwenNote、A2、Eva、千问 AI 眼镜、乐奇 AI 眼镜等硬件结合,让用户不必开电脑手机,直接动嘴发起任务、在对话里追加条件或修改需求。从 ASR 的润色与方言、到 ASR-Next 的泛音频理解、TTS 的跨语言音色、TTS-Next 的完整音频创作、再到 Realtime 的拟人共情与工具调用,千问这五款模型沿着五条清晰技术路径同时推进,把”能听懂、能创作、能聊天”打包成语音这一连接人、内容与 AI 的自然入口,而九成五的 ASR 降价,则把这道入口的门槛几乎拆到了地平线以下。

