该模型专注于语音分割聚类(Diarization)任务,开放了权重数据,能够精准识别对话中任意时刻的说话者,支持最多 8 人同时发声的实时及录音音频处理。此次英伟达推出轻量级且免费的高精度语音分割模型,大幅降低了复杂语音分析的技术门槛。这一动作不仅为实时会议记录、智能客服与多角色语音交互等应用提供了极具性价比的底层支撑,也预示着多说话人识别技术在端侧与实时商业场景下的落地将进一步提速。
该模型专注于语音分割聚类(Diarization)任务,开放了权重数据,能够精准识别对话中任意时刻的说话者,支持最多 8 人同时发声的实时及录音音频处理。此次英伟达推出轻量级且免费的高精度语音分割模型,大幅降低了复杂语音分析的技术门槛。这一动作不仅为实时会议记录、智能客服与多角色语音交互等应用提供了极具性价比的底层支撑,也预示着多说话人识别技术在端侧与实时商业场景下的落地将进一步提速。