小模型开源微软视觉 多模态模型

Phi-3.5-vision 3.5-vision

Phi-3.5系列 · Microsoft · 2024-08发布

开源支持本地部署多模态国内可直连有免费额度长上下文

模型介绍

微软 Phi-3.5-vision 是多模态小模型,4.2B 参数,128K 上下文,图像理解与视频理解兼顾,MIT 商用自由。

模型基础信息

模型系列Phi-3.5系列
开发机构Microsoft
发布时间2024-08
参数规模4.2B
上下文窗口128K
模型类型多模态(文本+图像+视频)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

MIT 完全商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 多模态小模型
  • 128K
  • MIT 商用
  • 内置视频支持

⚠️ 短板与局限

  • 中文一般
  • 能力有限
  • 生态小

🎯 适用场景

  • 图像问答
  • 视频理解
  • 端侧多模态
  • OCR

模型使用教程

本章节整理 Phi-3.5-vision 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run phi-3-5-vision 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run phi-3-5-vision "用中文介绍一下Phi-3.5-vision"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Microsoft/Phi-3.5-vision --local-dir ./phi-3-5-vision

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('Microsoft/Phi-3.5-vision')
tok = AutoTokenizer.from_pretrained('Microsoft/Phi-3.5-vision')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

Phi-3.5-vision 是微软 4.2B 多模态模型,轻量且 MIT 许可,本地图文理解速度快。

  1. transformers 加载:

pip install transformers==4.44.2 accelerate

python -c "from transformers import AutoModelForCausalLM, AutoProcessor; m=AutoModelForCausalLM.from_pretrained('microsoft/Phi-3.5-vision-instruct', trust_remote_code=True, torch_dtype='float16').cuda(); p=AutoProcessor.from_pretrained('microsoft/Phi-3.5-vision-instruct', trust_remote_code=True); print('图片问答就绪')"

  1. vLLM 支持该模型,可起 OpenAI 兼容服务。

Tips:4.2B 约 10GB 显存;英文图文强、中文一般;适合轻量 OCR/VQA。

💡 使用小技巧

轻量多模态首选之一。

❓ 常见问题 FAQ

Q1:Phi-3.5-vision 特点?\nA1:小尺寸+128K+MIT。

访问备注与注意事项