北大多模态开源视频理解 多模态模型

Video-LLaVA Video-LLaVA

Video系列 · Peking University · 2023-11发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

面向视频理解的开源多模态模型,可对视频进行问答与摘要,统一了图像与视频指令。

模型基础信息

模型系列Video系列
开发机构Peking University
发布时间2023-11
参数规模7B
上下文窗口未公开
模型类型多模态(视频 + 文本)
中文能力良好
使用方式网页体验 / 本地部署

免费额度与收费政策

按量付费 订阅

模型能力介绍

✅ 核心优势

  • 视频问答
  • 开放权重
  • 统一训练

⚠️ 短板与局限

  • 长视频受限

🎯 适用场景

  • 视频摘要
  • 监控分析
  • 视觉检索

模型使用教程

本章节整理 Video-LLaVA 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

暂无内容,可前往官方文档查看。

该模型支持本地部署,教程整理中,敬请期待。