ASROpenAI开源语音识别 多模态模型

Whisper(语音识别) large-v3

OpenAI Whisper系列 · OpenAI · 2022-09发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

OpenAI 开源的语音识别模型,支持 99 种语言的转写与翻译,含弱监督多语言训练,可本地运行,是主流开源 ASR 方案,社区优化版更快。

模型基础信息

模型系列OpenAI Whisper系列
开发机构OpenAI
发布时间2022-09
参数规模39M ~ 1.5B
上下文窗口30s 音频窗口
模型类型语音识别(ASR)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

完全免费开源

免费规则详情

MIT 协议完全免费,可本地部署与商用。

收费标准简介

完全免费;仅需硬件。

模型能力介绍

✅ 核心优势

  • 多语言转写(99 种语言)
  • 支持翻译功能
  • 本地运行保护隐私
  • 社区优化版(faster-whisper)性能好

⚠️ 短板与局限

  • 长音频需切分处理
  • 实时性一般(非流式)
  • 较大模型需要显存

🎯 适用场景

  • 视频/会议字幕
  • 录音转文字
  • 多语言翻译
  • 语音产品中台

模型使用教程

本章节整理 Whisper(语音识别) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

OpenAI Whisper 支持语音转写与翻译。本地化使用保证隐私与离线。

命令行:whisper audio.mp3 --language zh --model large-v3

pip install -U openai-whisper
# 或更快
pip install faster-whisper
import whisper
model = whisper.load_model("large-v3")
result = model.transcribe("audio.mp3", language="zh")
print(result["text"])
pip install faster-whisper
from faster_whisper import WhisperModel
model = WhisperModel("large-v3", device="cuda", compute_type="float16")
segments, info = model.transcribe("audio.mp3", language="zh")
for seg in segments:
    print(seg.text)

💡 使用小技巧

pip install faster-whisper 加入口 GPU 加速。

中文转写推荐 large-v3。

❓ 常见问题 FAQ

Q1:Whisper 免费吗?

A1:完全免费开源。

Q2:转写准确率高吗?

A2:较高,large 模型中文优秀。

访问备注与注意事项