Agent Skill 设计与创意

Gemini技能

通过Gemini官网(gemini.google.com)执行图像生成、对话等操作。当用户提及“生图/画图/绘图/nano banana/nanobanana/生成图片”等关键词时触发。操作优先级分为三级:首选MCP工具,次选Skill脚本,最后为连接Skill浏览器手动操作(需用户授权)。禁止自行启动外部浏览器访问Gemini。

查看 GitHub 仓库 ↗ ⭐ 827 Stars

📌 Skill基础信息

Skill名称:gemini-skill

简称:Gemini

来源:社区第三方(WJZ-P)

运行宿主:仅支持通过 MCP(Model Context Protocol)协议运行的 Agent 工具,例如 Claude-Code CLI 或其他兼容 MCP 的 AI 开发环境

核心定位:通过 Gemini 官网(gemini.google.com)实现自动化生图与对话操作,适用于需要快速生成图像或与 Gemini 交互的 AI 辅助开发场景。


🧩 内部核心组成

该 Skill 主要通过 MCP 工具提供服务,内部封装了完整的浏览器自动化流程,包括会话管理、图像生成与提取、消息发送等功能。

子Agent集合

【无公开信息】

斜杠命令

【无公开信息】

MCP 工具列表

工具名功能简述
gemini_generate_image完整生图流程,包括发送提示词、等待生成、保存图片
gemini_new_chat新建空白对话
gemini_temp_chat进入临时对话模式(不保留历史)
gemini_switch_model切换 Gemini 模型(pro/quick/think)
gemini_send_message发送文本消息并等待回复
gemini_upload_images上传图片到输入框
gemini_get_images获取会话中所有图片的元信息
gemini_extract_image提取指定图片并保存到本地
gemini_download_full_size_image下载完整尺寸高清图片
gemini_share_latest_image为图片创建公开分享链接
gemini_get_all_text_responses获取所有文字回复
gemini_get_latest_text_response获取最新文字回复
gemini_check_login检查 Google 账号登录状态
gemini_navigate_to打开指定 Gemini 页面
gemini_probe探测页面元素状态
gemini_reload_page刷新页面
gemini_browser_info获取浏览器连接信息

模板文件

【无公开信息】

Hooks钩子

【无公开信息】

规则约束

  • 操作优先级必须遵守:MCP 工具 > Skill 脚本 > 手动连接浏览器(需用户授权)
  • 禁止自行启动外部浏览器访问 Gemini
  • 所有 MCP 工具均为同步阻塞调用,需设置足够超时时间(≥180秒)

目录结构

【无公开信息】


🛠 安装与启用方式

  1. 安装命令

```bash

skills install --user WJZ-P/gemini-skill

```

  1. MCP 客户端配置

在 MCP 客户端配置文件中添加:

```json

{

"mcpServers": {

"gemini": {

"command": "node",

"args": ["<项目绝对路径>/src/mcp-server.js"]

}

}

}

```

  1. 手动启动方式

也可通过 npm run mcp 手动启动 MCP 服务。


📋 标准工作流

  1. 用户输入包含触发关键词(如“生图”、“画图”、“nano banana”等)的指令;
  2. AI 调用 MCP 工具,首选 gemini_generate_image 进行一站式生图;
  3. 工具内部执行

- 自动启动或连接浏览器 Daemon;

- 新建会话或使用现有会话;

- 发送生成指令并等待生成完成;

- 提取生成的图片并保存到本地;

  1. 返回结果:工具返回本地图片路径或错误信息;
  2. 可选后续操作:如需要分享链接,可继续调用 gemini_share_latest_image

⚠️ 关键限制、缺陷、注意事项

  1. 平台限制:仅支持通过 MCP 协议的 Agent 工具运行,无法独立使用;
  2. Token 消耗:生图操作耗时较长(60~180秒),需注意上下文长度限制;
  3. 适用项目:适合需要快速原型生成图像、概念设计的创意项目;
  4. 不适用项目:对实时性要求高的生产环境、需要高并发处理的场景;
  5. 已知坑点

- 必须设置足够长的超时时间(≥180秒);

- 页面异常时需手动调用诊断工具;

- 依赖稳定的网络环境访问 gemini.google.com;

  1. 生产环境:目前不建议用于生产环境,适合内部工具或实验性项目。

✅ 适用场景 & ❌ 不适合场景

✅ 适用场景

  • 开发者需要快速生成概念图、设计草图;
  • 创意工作者需要视觉灵感辅助;
  • 实验性项目中的图像生成需求;
  • 内部工具链中的自动化图像处理环节。

❌ 不适合场景

  • 高并发生产环境中的图像生成;
  • 对生成速度有严格要求的实时应用;
  • 需要完全离线工作的环境;
  • 无法稳定访问 Google 服务的网络环境。

如何安装

skills install --user WJZ-P/gemini-skill

通用安装教程:在哪里输入上面的命令

上面的命令本质是在「终端 / 命令行」中调用技能管理器,把该 Skill 下载并注册到你的 AI 工具。各主流工具打开终端的位置不同,按下面操作即可:

  1. 打开工具自带的终端面板,或系统终端(macOS「终端」、Windows「PowerShell」、Linux「Terminal」)。
  2. 把上面的安装命令复制进去,回车运行,等待下载与注册完成。
  3. 重启或重新加载 AI 工具,让新安装的 Skill 被识别。
  4. 新建对话并触发:直接描述用途,或通过该工具的技能 / 斜杠菜单选中此 Skill。
Claude 桌面版(macOS / Windows)

桌面版没有内置命令行,Skill 需通过 Claude Code CLI 安装。打开系统终端,先执行 npm install -g @anthropic-ai/claude-code,再运行上面的安装命令;完成后完全退出并重新打开 Claude。

Claude Code(终端 CLI)

直接在项目目录的终端里运行上面的命令即可。也可先输入 claude 启动交互界面,再在对话中引用该 Skill(/ 斜杠菜单或直接描述用途)。

VS Code(含 GitHub Copilot)

打开终端面板:菜单「终端 → 新建终端」,或快捷键 Ctrl+`(macOS 为 ⌃+`)。在终端里运行上面的命令;装完后执行「重新加载窗口」(Ctrl+Shift+P → Reload Window),让 Copilot 等扩展识别新技能。

Cursor

底部「终端」面板(Ctrl+`)即是内置终端。粘贴运行上面的命令,完成后在命令面板执行「Reload Window」刷新,再开始对话。

Windsurf

底部「终端」面板运行命令;也可直接使用其内置 Agent 终端,在对话侧执行安装。

其他工具(ChatGPT、本地脚本等)

不支持本地终端的产品,可先在本机终端完成安装,再在对话中描述该 Skill 的能力让其调用;不同工具的命令格式请以其官方文档为准。

风险提示

✅ 低风险

自动扫描未发现高危命令、隐私抓取或数据外传行为。仍建议安装前快速浏览仓库代码。

相似 Skill 推荐

A/B测试
sickn33/agentic-awesome-skills
低风险

当用户需要规划、设计或实施A/B测试/实验,或构建增长实验项目时使用。适用于用户提及“A/B测试”、“拆分测试”、“实验”、“测试此变更”、“变体文案”、“多变量测试”、“假设”、“是否应测试此内容”等场景。

花叔设计
alchaincyf/huashu-design
中风险

花叔Design——用HTML做高保真原型、幻灯片、动画、可视化与专家评审。任何新设计100%先出三个方向初稿给用户选(指定风格/品牌也不豁免),选定后才执行。触发词:做原型、PPT、幻灯片、动画、设计风格、评审、做个H

cdxgen
cdxgen/cdxgen
中风险

从源代码和容器镜像为您的项目创建CycloneDX物料清单(BOM)。支持多种语言和包管理器。可集成到CI/CD流程中,自动提交至Dependency Track服务器。

FSE实验设计
brycewang-stanford/Awesome-Journal-Skills
低风险

用于设计或评审ESEC/FSE实证评估,涵盖真实主体系统、公平基准、SE标准统计与效应量、定性与混合方法严谨性、污染感知的LLM消融实验、挖掘研究的可追溯性,以及证据与软件工程主张形态的匹配。