阿里发布 Qwen3.8-Omni-Flash:原生全模态、百万上下文,音频成本砍掉 98%

阿里巴巴旗下 Qwen 团队近日发布新一代原生全模态模型 Qwen3.8-Omni-Flash,把音频、视频理解与 AI 智能体能力进一步拧到了一起。Qwen 称音频输入的估算成本每小时下降超过 98%,音频加视频输入每小时下降超过 93%—— 按官方口径,每小时成本以两分钟素材的处理价乘以 30 计算,视频按 720p、每秒 1 帧输入。超过 98% 的音频成本降幅一旦兑现,长时间会议录音、播客、直播和海量视频素材的自动分析将变得前所未有的便宜,Qwen 与 Google Gemini 在多模态赛道上的贴身缠斗,也会因此再升一级。

原文连接