阿里巴巴旗下 Qwen 团队近日发布新一代原生全模态模型 Qwen3.8-Omni-Flash,把音频、视频理解与 AI 智能体能力进一步拧到了一起。它支持文本、图像、音频和视频四种输入,并提供100万 Token 上下文窗口;与上一代 Qwen3.5-Omni-Plus 相比,官方称其在29项基准测试中的平均成绩提升超过25%。 这次 最大 的变化不是堆能力,而是处理方式:它不是把语音识别、图像识别简单拼接,而是从模型层面原生处理不同类型的信息。阿里的意图很明确——让模型不只是”看懂”或”听懂”音视频,还能在理解之后规划任务、调用工具、把活干完。
阿里发布 Qwen3.8-Omni-Flash:原生全模态、百万上下文,音频成本砍掉 98%
隐藏内容,支付积分阅读
已有90人购买此隐藏内容
隐藏内容,支付费用阅读
¥
已有86人购买此隐藏内容
隐藏内容,仅限以下用户组阅读
隐藏内容,登录后阅读
登录之后方可阅读隐藏内容
隐藏内容,评论后阅读
请在下面参与讨论之后,方可阅读隐藏内容
隐藏内容,加入AI圈子后阅读
您需要加入AI圈子之后才能查看帖子内容
您猜对了答案,下面是向您展示的隐藏信息:
[]
[¥]
向
提问:
隐藏内容,猜对答案后阅读
猜错啦:您选中的是「」,正确答案是:「」
多选人参与投票
单选人参与投票
PK人参与PK
·已选
已选·
投票后查看结果,您的选择是?
思想因碰撞产生火花,真理因辩论获得升华
热门评论
:
请先登录!
图片审查中...
登录之后回答问题,请先登录!
编辑答案:
我的回答:
最多上传一张图片和一个附件
x


