TTS开源语音阿里 多模态模型

CosyVoice(阿里开源 TTS) CosyVoice 2

CosyVoice系列 · 阿里(FunAudioLLM) · 2024-04发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

阿里开源语音生成模型 CosyVoice,零样本语音克隆、多语种支持,音色自然,Apache-2.0 可商用。

模型基础信息

模型系列CosyVoice系列
开发机构阿里(FunAudioLLM)
发布时间2024-04
参数规模约 2B
上下文窗口文本转语音
模型类型文本转语音
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Apache-2.0 可商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 零样本克隆
  • 多语种
  • 自然度高
  • pache

⚠️ 短板与局限

  • 需一定显卡
  • 情感控制有限
  • 长音频一般

🎯 适用场景

  • 语音合成
  • 有声书
  • 语音克隆
  • 配音

模型使用教程

本章节整理 CosyVoice(阿里开源 TTS) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

输入文本或音频生成语音 / 音乐。

示例:为文案生成配音「欢迎使用 AI 语音合成」

注册 阿里(FunAudioLLM) 账号获取 API Key。

export API_KEY=sk-xxxx

上传音频或文本,返回合成结果。示例见 阿里(FunAudioLLM) 官方文档。

CosyVoice 是阿里开源的 TTS 模型,CosyVoice2(0.5B)约 6-8GB 显存即可运行。

  1. 克隆仓库:git clone --recursive https://github.com/FunAudioLLM/CosyVoice && cd CosyVoice
  2. 安装依赖:pip install -r requirements.txt(建议 Python 3.10 + CUDA)。
  3. 将权重放到 pretrained_models/(用 hf-mirror 下载 CosyVoice2-0.5B,约 2GB)。
  4. 零样本克隆合成(中文女声):

python cosyvoice/run.py --mode sft --llm CosyVoice2-0.5B --text "你好,欢迎使用 CosyVoice" --spk bailing

  1. 试听与更多音色:项目 examples 目录带示例音频,可直接替换参考音频做克隆。

Tips:js/trt 加速可选,一般 CPU/单卡即可稳定合成。

💡 使用小技巧

中文音色效果好。

❓ 常见问题 FAQ

Q1:CosyVoice 能克隆声音吗?\nA1:支持零样本克隆。

访问备注与注意事项