全模态实时开源阿里 多模态模型

Qwen2.5-Omni 2.5-Omni

Qwen2.5系列 · 阿里巴巴 · 2025-03发布

开源支持本地部署多模态国内可直连有免费额度长上下文代码专用

模型介绍

阿里开源全模态模型 Qwen2.5-Omni,文本、图像、音频、视频实时理解与生成,端侧可跑,Apache-2.0 商用。

模型基础信息

模型系列Qwen2.5系列
开发机构阿里巴巴
发布时间2025-03
参数规模约 30B
上下文窗口全模态
模型类型全模态(文+图+音+视)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Apache-2.0 完全商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 全模态
  • 实时对话
  • 中文强
  • pache

⚠️ 短板与局限

  • 显存需求高
  • 生态新
  • 能力有限

🎯 适用场景

  • 实时助手
  • 语音视频
  • 全模态应用
  • 端侧

模型使用教程

本章节整理 Qwen2.5-Omni 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

上传图片/表格/文档,进行视觉问答、OCR 与图表理解。

# 多模态输入:图片 base64 + 文本问题

注册 阿里巴巴 账号获取 API Key。

export API_KEY=sk-xxxx
curl  -F image=@test.png -F prompt="图片里有什么?"

Qwen2.5-Omni 约 30B,可先跑 7B 版本验证,官方仓库支持端侧(Thinks 模型)。

  1. 克隆仓库:git clone https://github.com/QwenLM/Qwen2.5-Omni && cd Qwen2.5-Omni
  2. 安装依赖:pip install -r requirements.txt(transformer 需匹配官方版本)。
  3. 用 transformers 加载(权重 hf-mirror 可下):

python -c "from transformers import AutoModelForCausalLM, AutoProcessor; m=AutoModelForCausalLM.from_pretrained('Qwen/Qwen2.5-Omni-7B', trust_remote_code=True, torch_dtype='float16').cuda(); p=AutoProcessor.from_pretrained('Qwen/Qwen2.5-Omni-7B', trust_remote_code=True)"

  1. 官方还提供在线 demo(gradio 一键启动)与流式对话示例,语音输入输出开箱即用。

Tips:端侧 Thinks 模型可用安卓部署;显存不足请用 4bit 量化。

💡 使用小技巧

全模态开源代表。

❓ 常见问题 FAQ

Q1:Omni 特点?\nA1:全模态+实时。

访问备注与注意事项