Google开源视觉轻量 多模态模型

PaliGemma(Google 视觉) PaliGemma

PaliGemma系列 · Google · 2024-05发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

Google 开源 PaliGemma,基于 Gemma 的视觉语言模型,3B 轻量,支持图文问答、检测与分割,端侧友好。

模型基础信息

模型系列PaliGemma系列
开发机构Google
发布时间2024-05
参数规模3B
上下文窗口图文理解
模型类型多模态(视觉+文本)
中文能力一般
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Gemma 许可免费商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 轻量
  • 检测分割
  • Gemma 生态
  • 端侧友好

⚠️ 短板与局限

  • 中文一般
  • 3B 能力有限
  • 生态较新

🎯 适用场景

  • 视觉问答
  • 目标检测
  • 图像分割
  • 端侧

模型使用教程

本章节整理 PaliGemma(Google 视觉) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

上传图片/表格/文档,进行视觉问答、OCR 与图表理解。

# 多模态输入:图片 base64 + 文本问题

注册 Google 账号获取 API Key。

export API_KEY=sk-xxxx
curl  -F image=@test.png -F prompt="图片里有什么?"

PaliGemma 3B 轻量,约 8GB 显存即可跑,端侧也可用。

  1. 安装依赖:pip install transformers==4.44.2 torchvision(需匹配 transformers 版本)。
  2. 下载权重(google/paligemma-3b-mix-224,hf-mirror 可下)并推理:

python -c "from transformers import AutoProcessor, PaliGemmaForConditionalGeneration; m=PaliGemmaForConditionalGeneration.from_pretrained('google/paligemma-3b-mix-224', torch_dtype='float16').cuda(); p=AutoProcessor.from_pretrained('google/paligemma-3b-mix-224'); i=p(text='caption', images=Image.open('x.jpg'), return_tensors='pt').to('cuda'); print(p.decode(m.generate(**i, max_new_tokens=64)[0], skip_special_tokens=True))"

  1. 任务由 prompt 决定:caption / detect / segment / VQA 等(mix 版本已内置多任务权重)。

Tips:mix-224 通用,需更高精度可选 448 版本;CPU 也能跑只是慢。

💡 使用小技巧

轻量视觉多模态首选。

❓ 常见问题 FAQ

Q1:PaliGemma 特点?\nA1:Gemma 系轻量视觉。

访问备注与注意事项