FishTTS克隆开源 多模态模型

Fish Speech(开源 TTS) Fish Speech 1.5

Fish Speech系列 · Fish Audio · 2023-11发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

Fish Speech 开源多语言 TTS,15 秒音频即可克隆音色,中文效果好,社区热度高。

模型基础信息

模型系列Fish Speech系列
开发机构Fish Audio
发布时间2023-11
参数规模1B
上下文窗口文本转语音
模型类型文本转语音
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源(非商业)

免费规则详情

CC-BY-NC 非商业;商业需授权。

收费标准简介

本地免费(非商业)。

模型能力介绍

✅ 核心优势

  • 克隆音色快
  • 中文好
  • 多语�
  • 社区热

⚠️ 短板与局限

  • 非商业许可
  • 情感一般
  • 需显卡

🎯 适用场景

  • 配音
  • 游戏角色
  • 有声内容
  • 研究

模型使用教程

本章节整理 Fish Speech(开源 TTS) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

输入文本或音频生成语音 / 音乐。

示例:为文案生成配音「欢迎使用 AI 语音合成」

注册 Fish Audio 账号获取 API Key。

export API_KEY=sk-xxxx

上传音频或文本,返回合成结果。示例见 Fish Audio 官方文档。

Fish Speech 支持本地运行,1B 模型约 8GB 显存即可合成。

  1. 克隆仓库:git clone https://github.com/fishaudio/fish-speech && cd fish-speech
  2. 安装依赖:pip install -e .(Python 3.10+ / PyTorch 2.1+)。
  3. 下载权重:checkpoints/fish-speech-1.5(约 1.5GB,hf-mirror 可下),另需 VQGAN 权重。
  4. 用参考音频克隆音色:

python tools/vqgan/inference.py -i reference.wav -o output.wav 先转语音 token,

python tools/llama/generate.py -t 5s.wav -p "你好,这是一段本地合成的声音。" 合成。

  1. 也提供 webui:python tools/webui/app.py 打开本地界面直接操作。

Tips:参考音频建议 5-15 秒、无背景噪音,克隆效果更好。

💡 使用小技巧

15 秒音频即可克隆。

❓ 常见问题 FAQ

Q1:Fish Speech 特色?\nA1:快速音色克隆。

访问备注与注意事项