SunoTTS开源音乐 多模态模型

Bark(开源 TTS) Bark

Bark系列 · Suno · 2023-04发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

Suno 开源 TTS 模型 Bark,可生成多语种语音、音乐、音效与「非语言」声音,情绪表达丰富。

模型基础信息

模型系列Bark系列
开发机构Suno
发布时间2023-04
参数规模~1.2B
上下文窗口文本转语音+音乐
模型类型文本转语音 + 音乐
中文能力一般
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

MIT 许可(注意使用条款)。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 多语种
  • 音乐音效
  • 情绪丰富
  • 开源

⚠️ 短板与局限

  • 长音频不稳
  • 克隆弱
  • 中文一般

🎯 适用场景

  • 语音合成
  • 音效生成
  • 创意音频
  • 研究

模型使用教程

本章节整理 Bark(开源 TTS) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

输入文本或音频生成语音 / 音乐。

示例:为文案生成配音「欢迎使用 AI 语音合成」

注册 Suno 账号获取 API Key。

export API_KEY=sk-xxxx

上传音频或文本,返回合成结果。示例见 Suno 官方文档。

Bark 可本地运行,官方 pip 包开箱即用,CPU 也能跑(较慢,推荐 8GB 显存显卡)。

  1. 安装:pip install suno-bark(首次运行自动下载权重,可先配置 HF_ENDPOINT=https://hf-mirror.com)。
  2. 生成语音:

python -c "from bark import generate_audio, SAMPLE_RATE; audio = generate_audio('你好,这是一段本地生成的语音。', history_prompt='v2/zh_speaker_2'); import scipy.io.wavfile as w; w.write('out.wav', SAMPLE_RATE, audio)"

  1. 保存音频用 scipy(pip install scipy);多语种需安装相应语言权重,中文需再下载文本编码层。

Tips:中文效果需要 speaker 提示词(history_prompt 选 v2/zh_*);生成长句建议拆分。

💡 使用小技巧

效果有惊喜但需调参。

❓ 常见问题 FAQ

Q1:Bark 能干嘛?\nA1:语音+音乐+音效。

访问备注与注意事项