讯飞星火语音基座大模型上线:0.65B 编码器配 30B MoE,纯国产算力训练

语音基座大模型不再只做语音转文字,而是直接理解语音:一次性听懂人声、环境音、音乐等,还能理解声音里的语义、情绪和场景。此次首发的 Spark-Audio-1.0-Preview 采用 0.65B(Dense 结构)的音频编码器,搭配 30B-A3B(MoE 结构)的大语言模型,使用了 1300 万小时音频以及大量文本数据,基于纯国产算力集群训练完成。与讯飞星火大模型的”1+N”体系类似,在语音基座大模型上也可进行微调,开发语音识别、语音同传、语音交互等专用模型或系统。

原文连接