YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

中英双语语音合成模型(支持声音克隆)· 社区版

Downloaded from https://modelscope.cn/models/dengcunqin/pocket-tts-zh-en/files

一个中英双语语音合成(TTS)模型,支持声音克隆:给一段几秒钟的参考音频,即可用这个声音读出任意中英文文本。基于 CALM / Lagrangian Self Distillation(LSD)架构,可在 CPU / GPU 上自托管部署,数据不出本地。

🌐 在线体验https://www.tulingyun.com/tts_clone.html


✨ 特性

  • 🌏 中英双语:中文(普通话)+ 英文,同一条文本可混合中英文。
  • 🎙️ 声音克隆:一段参考音频即可复刻音色,无需训练。
  • 🖥️ 自托管 / 私有化:权重本地运行,音频与数据不经过第三方,适合隐私敏感场景。
  • 💻 CPU 可跑:CPU 上可推理(CPU 4核心 RTF 0.1)。
  • 📦 轻量:6 层 FlowLM + Mimi 编解码器。

🧠 模型详情

说明
架构 Mimi 神经编解码器 + FlowLM(Transformer)+ LSD 目标
推理格式 ONNX(step_onnx_int8 = int8 量化 / step_onnx = fp32)
采样率 24 kHz(Mimi 原生)
帧率 12.5 Hz
FlowLM 6 层,d_model 1024
文本编码 SentencePiece BPE,词表 25,055
语言 中文(普通话)+ 英文
训练数据 WenetSpeech4TTS + LibriTTS

🚀 快速开始

1. 安装依赖

pip install onnxruntime soundfile sentencepiece numpy scipy

2. 下载模型

ModelScope(魔搭) 下载模型文件:

仓库包含:

  • step_onnx_int8/:int8 量化 ONNX 模型(CPU 推理推荐,更小更快)
  • step_onnx/:fp32 ONNX 模型
  • chn_jpn_yue_eng_ko_spectok.bpe.model:SentencePiece 词表
  • demo.py / step_runtime.py:推理运行时代码
  • Vivian.wav:示例参考音色(可换成自己的任意 wav)

3. 合成(demo.py)

# int8 模型(CPU 推荐)
python demo.py --model-dir step_onnx_int8 --reference Vivian.wav --output output.wav

# fp32 模型
python demo.py --model-dir step_onnx --reference Vivian.wav --text "你好,世界。" --output output.wav

demo.py 为流式合成,会打印首帧延迟RTF(实时倍速);参考音色换成你自己的 wav 即可,会自动重采样到 24kHz。

📝 文本预处理说明(重要)

本仓库发布的是 ONNX 模型 + 最简推理 demo

  • 短文本(一句话 / 一条通知):开箱即用,直接合成。
  • ⚠️ 长文本(一段话 / 文章 / 有声书):需要文本预处理(长文本切割、逐块生成、拼接),否则长文本容易出现跑飞、重复、断句异常。
  • ⚠️ demo.py 只做最简 BPE 分词:不含数字转中文、英文小写等归一化(chs2norm),文本里有数字/大写英文时请自行先做归一化。

文本预处理(长文本切割合并 + 完整归一化)不包含在本仓库中,属于商用授权的一部分;也可自行实现相应逻辑。

🔖 版本说明

社区版(本仓库) 商用版
权重 ✅ 200k 完整权重 ✅ 同权重
短文本合成 ✅ 开箱即用
长文本预处理 ❌(需自行实现) ✅ 预处理
商用授权
私有化部署 / 技术支持

📄 许可证

  • 代码:Apache License 2.0。
  • 模型权重(社区版):CC BY-NC 4.0 —— 允许自由使用、修改、再分发,仅限非商业用途,需署名。

⚠️ 商业使用(将模型集成到对外收费的产品/服务、企业内部商用等)需单独购买商用授权。商用授权包含:商用合法使用权、长文本预处理、私有化部署与技术支持。

联系见文末「关于作者」。

⚠️ 免责声明

  • 本项目仅供合法用途,请勿用于诈骗、伪造他人声音、传播虚假信息等违法活动。
  • 声音克隆涉及被克隆者的肖像/声音权,请确保已获得本人授权。
  • 社区版不提供任何形式的担保,使用风险自负。

👤 关于作者

作者常驻广州,专注语音技术方向(ASR/TTS),目前正积极寻找本地相关工作机会。

  • 📧 邮箱:2735033883@qq.com
  • 💬 微信:game_for_enjoy(请备注来意)
  • FunASR 群:找「小邓」

如有兴趣交流技术或商用合作,欢迎联系。

🙏 致谢

本项目基于 kyutai-labs/pocket-tts(CALM / LSD 架构)与开源语音数据集(WenetSpeech4TTS、LibriTTS)构建,特此致谢。

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support