阿里发布 Qwen3.8-Omni-Flash:原生全模态、百万上下文,音频成本砍掉 98%

阿里巴巴旗下 Qwen 团队近日发布新一代原生全模态模型 Qwen3.8-Omni-Flash,把音频、视频理解与 AI 智能体能力进一步拧到了一起。它支持文本、图像、音频和视频四种输入,并提供100万 Token 上下文窗口;与上一代 Qwen3.5-Omni-Plus 相比,官方称其在29项基准测试中的平均成绩提升超过25%。 这次 最大 的变化不是堆能力,而是处理方式:它不是把语音识别、图像识别简单拼接,而是从模型层面原生处理不同类型的信息。阿里的意图很明确——让模型不只是”看懂”或”听懂”音视频,还能在理解之后规划任务、调用工具、把活干完。

圈主 管理员

热门评论
:
该帖子评论已关闭
图片审查中...
编辑答案: 我的回答: 最多上传一张图片和一个附件
x
x