YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
中英双语语音合成模型(支持声音克隆)· 社区版
Downloaded from https://modelscope.cn/models/dengcunqin/pocket-tts-zh-en/files
一个中英双语语音合成(TTS)模型,支持声音克隆:给一段几秒钟的参考音频,即可用这个声音读出任意中英文文本。基于 CALM / Lagrangian Self Distillation(LSD)架构,可在 CPU / GPU 上自托管部署,数据不出本地。
✨ 特性
- 🌏 中英双语:中文(普通话)+ 英文,同一条文本可混合中英文。
- 🎙️ 声音克隆:一段参考音频即可复刻音色,无需训练。
- 🖥️ 自托管 / 私有化:权重本地运行,音频与数据不经过第三方,适合隐私敏感场景。
- 💻 CPU 可跑:CPU 上可推理(CPU 4核心 RTF 0.1)。
- 📦 轻量:6 层 FlowLM + Mimi 编解码器。
🧠 模型详情
| 项 | 说明 |
|---|---|
| 架构 | Mimi 神经编解码器 + FlowLM(Transformer)+ LSD 目标 |
| 推理格式 | ONNX(step_onnx_int8 = int8 量化 / step_onnx = fp32) |
| 采样率 | 24 kHz(Mimi 原生) |
| 帧率 | 12.5 Hz |
| FlowLM | 6 层,d_model 1024 |
| 文本编码 | SentencePiece BPE,词表 25,055 |
| 语言 | 中文(普通话)+ 英文 |
| 训练数据 | WenetSpeech4TTS + LibriTTS |
🚀 快速开始
1. 安装依赖
pip install onnxruntime soundfile sentencepiece numpy scipy
2. 下载模型
从 ModelScope(魔搭) 下载模型文件:
仓库包含:
step_onnx_int8/:int8 量化 ONNX 模型(CPU 推理推荐,更小更快)step_onnx/:fp32 ONNX 模型chn_jpn_yue_eng_ko_spectok.bpe.model:SentencePiece 词表demo.py/step_runtime.py:推理运行时代码Vivian.wav:示例参考音色(可换成自己的任意 wav)
3. 合成(demo.py)
# int8 模型(CPU 推荐)
python demo.py --model-dir step_onnx_int8 --reference Vivian.wav --output output.wav
# fp32 模型
python demo.py --model-dir step_onnx --reference Vivian.wav --text "你好,世界。" --output output.wav
demo.py 为流式合成,会打印首帧延迟与 RTF(实时倍速);参考音色换成你自己的 wav 即可,会自动重采样到 24kHz。
📝 文本预处理说明(重要)
本仓库发布的是 ONNX 模型 + 最简推理 demo:
- ✅ 短文本(一句话 / 一条通知):开箱即用,直接合成。
- ⚠️ 长文本(一段话 / 文章 / 有声书):需要文本预处理(长文本切割、逐块生成、拼接),否则长文本容易出现跑飞、重复、断句异常。
- ⚠️
demo.py只做最简 BPE 分词:不含数字转中文、英文小写等归一化(chs2norm),文本里有数字/大写英文时请自行先做归一化。
文本预处理(长文本切割合并 + 完整归一化)不包含在本仓库中,属于商用授权的一部分;也可自行实现相应逻辑。
🔖 版本说明
| 社区版(本仓库) | 商用版 | |
|---|---|---|
| 权重 | ✅ 200k 完整权重 | ✅ 同权重 |
| 短文本合成 | ✅ 开箱即用 | ✅ |
| 长文本预处理 | ❌(需自行实现) | ✅ 预处理 |
| 商用授权 | ❌ | ✅ |
| 私有化部署 / 技术支持 | ❌ | ✅ |
📄 许可证
- 代码:Apache License 2.0。
- 模型权重(社区版):CC BY-NC 4.0 —— 允许自由使用、修改、再分发,仅限非商业用途,需署名。
⚠️ 商业使用(将模型集成到对外收费的产品/服务、企业内部商用等)需单独购买商用授权。商用授权包含:商用合法使用权、长文本预处理、私有化部署与技术支持。
联系见文末「关于作者」。
⚠️ 免责声明
- 本项目仅供合法用途,请勿用于诈骗、伪造他人声音、传播虚假信息等违法活动。
- 声音克隆涉及被克隆者的肖像/声音权,请确保已获得本人授权。
- 社区版不提供任何形式的担保,使用风险自负。
👤 关于作者
作者常驻广州,专注语音技术方向(ASR/TTS),目前正积极寻找本地相关工作机会。
- 📧 邮箱:
2735033883@qq.com - 💬 微信:
game_for_enjoy(请备注来意) - FunASR 群:找「小邓」
如有兴趣交流技术或商用合作,欢迎联系。
🙏 致谢
本项目基于 kyutai-labs/pocket-tts(CALM / LSD 架构)与开源语音数据集(WenetSpeech4TTS、LibriTTS)构建,特此致谢。
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support