-
VoxCPM2:把 TTS 领域最基础的一个假设推翻了,然后发现效果更好
过去五年里,如果你问任何一个做 TTS 的人"语音合成的基本流程是什么",答案出奇一致:文本→分词器→语言模型→声码器→波形。分词器是整条链路的起点,是所有人默认的"基础设施"。没有 tokenizer,你怎么让模型学习语音? VoxCPM2 的回答是:为什么一定要有? 它把 TTS 领域赖以运转了五年以上的 tokenizer 直接拿掉了。模型在 Audi…- 1k
- 0
-
Voice-Pro:1万Star的开源语音AI工作站,功能越全,坑越多?
看到10.7k Stars的时候,我的第一反应很直接:又一个靠"对标ElevenLabs"上位的开源项目。GitHub上这类项目太多了,README写得天花乱坠,装完第一步就报错。 光看Star数我被骗了 但Voice-Pro不太一样。它把Whisper语音识别、多种TTS引擎、零样本语音克隆、Demucs人声分离、YouTube下载和实时翻译塞进了一个Gradio WebUI…- 33
- 0




