英伟达近日正式推出旗下首款开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,标志着其在语音生成与理解的底层架构上迈出重要一步。与以往需串联语音识别(ASR)、大语言模型(LLM)及语音合成(TTS)的传统分步架构不同,该模型通过统一网络直接完成流式语音理解与生成。作为首个在对话持续进行时支持工具调用的开源全双工模型,VoiceChat 11B 创新性地引入了独立的输出通道与预置的”保持”话术机制。
英伟达近日正式推出旗下首款开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,标志着其在语音生成与理解的底层架构上迈出重要一步。与以往需串联语音识别(ASR)、大语言模型(LLM)及语音合成(TTS)的传统分步架构不同,该模型通过统一网络直接完成流式语音理解与生成。作为首个在对话持续进行时支持工具调用的开源全双工模型,VoiceChat 11B 创新性地引入了独立的输出通道与预置的”保持”话术机制。