该模型改变了传统语音识别的任务输入方式,采用基于参考声纹的目标说话人识别机制。用户只需提供一段参考音频,模型便会利用声纹嵌入精准定位目标说话人,在多人混合音频中只转录该特定人物的语音,而其他人说话的内容、混响以及背景噪声均会被自动过滤,从而将复杂的混合音频任务转化为高效的目标说话人识别。小米此次在语音技术底层逻辑上的全新转向,标志着语音识别正从传统的”捕获所有声音”迈向聚焦于”锁定一个声音”的新发展阶段。
该模型改变了传统语音识别的任务输入方式,采用基于参考声纹的目标说话人识别机制。用户只需提供一段参考音频,模型便会利用声纹嵌入精准定位目标说话人,在多人混合音频中只转录该特定人物的语音,而其他人说话的内容、混响以及背景噪声均会被自动过滤,从而将复杂的混合音频任务转化为高效的目标说话人识别。小米此次在语音技术底层逻辑上的全新转向,标志着语音识别正从传统的”捕获所有声音”迈向聚焦于”锁定一个声音”的新发展阶段。