-
OpenAI Speech Skill:把语音生成从“一次性调用”变成“可复现工程”
你可能已经习惯了 TTS 的套路:调一个 API,传一段文本,选一个声音,拿回一个 MP3。这件事本身没什么新鲜的,ElevenLabs 两年前就做到了。但 OpenAI 这个 Speech Skill 做的事情不太一样,它不是在“生成声音”,而是在“把声音生成变成一个可复现的工程任务”。 我第一次翻它的 SKILL.md 时,印象最深的是这句话:“Prefer the bundled CLI f…- 1k
- 0
-
VoxCPM2:把 TTS 领域最基础的一个假设推翻了,然后发现效果更好
过去五年里,如果你问任何一个做 TTS 的人"语音合成的基本流程是什么",答案出奇一致:文本→分词器→语言模型→声码器→波形。分词器是整条链路的起点,是所有人默认的"基础设施"。没有 tokenizer,你怎么让模型学习语音? VoxCPM2 的回答是:为什么一定要有? 它把 TTS 领域赖以运转了五年以上的 tokenizer 直接拿掉了。模型在 Audi…- 1k
- 0
-
Voice-Pro:1万Star的开源语音AI工作站,功能越全,坑越多?
看到10.7k Stars的时候,我的第一反应很直接:又一个靠"对标ElevenLabs"上位的开源项目。GitHub上这类项目太多了,README写得天花乱坠,装完第一步就报错。 光看Star数我被骗了 但Voice-Pro不太一样。它把Whisper语音识别、多种TTS引擎、零样本语音克隆、Demucs人声分离、YouTube下载和实时翻译塞进了一个Gradio WebUI…- 30
- 0






