-
VoxCPM2 :这个 2B 模型的野心不只是”又一个 TTS”
正常人都觉得,语音合成这件事的终点就是把模型做得更大、数据喂得更多。XTTS、CosyVoice、F5-TTS,大家都是这条路:文本进去,切成离散 token,语言模型预测 token 序列,声码器还原波形。这套流程跑了三四年,大家忙着比谁的 MOS 分高零点几,比谁少了几毫秒延迟。VoxCPM2 没这么做,它直接把 Tokenizer 从流水线里删了。 这不是学术噱头。扔掉 Tokenizer …- 1.2k
- 0
-
VoxCPM2:把 TTS 领域最基础的一个假设推翻了,然后发现效果更好
过去五年里,如果你问任何一个做 TTS 的人"语音合成的基本流程是什么",答案出奇一致:文本→分词器→语言模型→声码器→波形。分词器是整条链路的起点,是所有人默认的"基础设施"。没有 tokenizer,你怎么让模型学习语音? VoxCPM2 的回答是:为什么一定要有? 它把 TTS 领域赖以运转了五年以上的 tokenizer 直接拿掉了。模型在 Audi…- 1.1k
- 0



