多模态模型

Google Gemini Omni Flash Omni Flash

Gemini Omni Flash系列 · Google DeepMind · 2026-05发布

闭源多模态有免费额度

模型介绍

Google Omni 系列首款模型,将 Gemini 推理与视频生成结合,支持文生视频、图生视频、参考生视频与对话式视频编辑,可理解物理规律。

模型基础信息

模型系列Gemini Omni Flash系列
开发机构Google DeepMind
发布时间2026-05
参数规模闭源(未公开)
上下文窗口文生视频(3–10 秒 720p)
模型类型多模态(视频生成+编辑)
中文能力良好
使用方式网页体验 / API调用

免费额度与收费政策

YouTube Shorts 免费 订阅 API

免费规则详情

YouTube Shorts / Create App 免费体验;Gemini App 需 AI Plus/Pro/Ultra 订阅;API 按量。

收费标准简介

按视频生成计费(以 ai.google.dev 价格页为准)。

模型能力介绍

✅ 核心优势

  • 文本+视频多模态输入
  • 对话式视频编辑
  • 理解物理规律
  • 参考生视频与语音音效生成

⚠️ 短板与局限

  • preview 阶段
  • 720p
  • 16:9/9:16
  • 国内直连受限

🎯 适用场景

  • 高质量视频创作
  • 对话式视频编辑
  • 多模态内容生产
  • 参考素材视频化

模型使用教程

本章节整理 Google Gemini Omni Flash 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:Google AI Plus / Pro / Ultra 订阅用户在 Gemini App 与 Google Flow 体验;YouTube Shorts 免费体验。
  • 能力简介:Google 推出的 Omni 系列首款模型,将 Gemini 的推理与视频生成结合,支持文生视频、图生视频、参考生视频与对话式视频编辑,可理解物理规律。
  • 适用场景:高质量视频创作、对话式视频编辑、多模态内容生产、参考素材视频化。
  • 使用建议:当前为 preview(gemini-omni-flash-preview),支持 720p、16:9 / 9:16。
  • 开发接入:Gemini API 开放,文本+视频多模态输入。
  1. 在 [Google AI Studio](https://aistudio.google.com) 创建 API Key(Omni 属 preview,逐步开放)。
  2. 或通过 Google Cloud Vertex AI 获取。
  3. 安装 SDK:
pip install -U google-genai
export GOOGLE_API_KEY=你的Key

Python 调用

from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
    model="gemini-omni-flash-preview",
    contents="一只猫在夕阳下的海边奔跑,电影质感",
    config=genai.types.GenerateContentConfig(
        response_modalities=["VIDEO", "TEXT"],
    ),
)
print(resp.candidates[0].content)

> 提示:支持 task 参数(text_to_video / image_to_video / reference_to_video / edit);大视频用 delivery="uri" 轮询下载。

💡 使用小技巧

模型 ID gemini-omni-flash-preview;支持 task 参数(text_to_video / image_to_video / reference_to_video / edit)。

❓ 常见问题 FAQ

Q1:谁可以用?

A1:AI Plus/Pro/Ultra 订阅用户 + YouTube Shorts 免费。

Q2:API 开放吗?

A2:Gemini API 已开放 preview。

访问备注与注意事项