← 返回笔记列表
第4期 · 开源项目
MOSS-TTS-Nano|0.1B 端侧声音克隆的语音模型
开源项目语音第4期
#open-source#tts#voice
0.1B 参数、纯 CPU 本地跑声音克隆,彻底拉低硬件门槛——几秒参考音频复刻音色,短视频配音够用。
显卡不再是声音克隆的入场券。这个只有 0.1B 参数的开源语音模型,直接把声音克隆的硬件门槛干碎了。
核心亮点
- 0.1B 参数量、纯 CPU 即可本地跑:不需要独立显卡,显存不够也能跑,普通四核笔记本就能推理声音克隆。
- 模型体积小:压缩后不到 300MB。
- 快速复刻:只需几秒参考音频即可完成音色复刻,输出 48kHz 高保真音频,支持 20 种语言,中文效果在线。
实用性
- 不是玩具级小模型:长文本可自动分块、流式实时生成,Mac、Windows 普通轻薄本都能部署。
- 提供 ONNX 版本,推理速度还能再提升一倍。
定位与边界
- 客观讲,音质上限比不上大参数量的 TTS 模型,但胜在极低硬件门槛。
- 做短视频配音、AI Agent 语音输出、本地小工具,完全够用,普通人不用再为玩语音克隆专门买显卡。
项目现状
- 开源项目,GitHub、ModelScope 均可找到。
- 提示:声音克隆务必获得本人授权,禁止用于伪造语音、诈骗等违规用途。
📝 我的点评
又一个把门槛打下来的典型:0.1B 参数纯 CPU 就能本地做声音克隆。对短视频团队和个人创作者,不用为配音买显卡,本地小工具够用。客观讲音质上限不如大参数模型,但『够用』本身就是产品力。产品视角:音频这条赛道,端侧小型化是确定性方向。合规红线也要守着:必须本人授权、禁止伪造诈骗,这样的工具才能长久。