AI MODELS DIRECTORY
AI 模型大全
收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型
面壁智能的全模态端侧模型,4B 参数可处理文本、图像与音频,主打单卡可运行的多模态 Agent 平台。
面向视频理解的开源多模态模型,可对视频进行问答与摘要,统一了图像与视频指令。
LLaVA 家族的多模态视觉语言模型,能处理图像、视频与表格等多模态内容,是开源视觉对话的代表。
智谱与清华联合开源的视觉语言模型,支持高清图像理解与文档 OCR,中文场景适配良好。
上海 AI Lab 与商汤的开源多模态视觉语言模型,开源榜上视觉理解能力最强的系列之一,可本地部署。
Meta 的跨语言编码器,100 种语言预训练,支持零样本跨语言迁移,多语言 NLP 的常用底座。
Google 通过鉴别器预训练的高效编码器,比 BERT 更省算力且效果更优。
BERT 的优化版本,采用更大的数据与动态掩码策略,在多个基准上显著超越 BERT。
Google 提出的双向预训练编码器,革命性提升 NLP 理解能力,是 Transformer 时代最重要的预训练模型之一。
Meta 提出的去噪自编码预训练模型,擅长摘要、翻译与生成任务,是序列到序列预训练的重要基础模型。
Google 的文本到文本统一框架,把 NLP 任务统一为 text-to-text,是迁移学习与预训练时代的重要基础模型。
SAM 2 扩展至视频分割,支持在视频中持续跟踪分割目标,API 沿用 SAM 交互方式。
Meta 发布的图像分割基础模型,可通过点选或文本在任意图像中分割目标,无需额外训练。
阿里开源的全模态模型,仅 2.8B 参数即可同时处理文本、图像与音频,端到端实时语音对话,主打轻量与开源。
Kokoro 是目前参数量最小但质量极高的开源 TTS 模型,82M 参数即可输出自然语音,可 CPU 一键部署。
Cartesia 的低延迟实时语音模型,延迟低至 40ms,支持开源权重,适合语音交互与 Agent。
Meta 开源的音频生成模型,可按文本描述生成旋律与配乐,支持续写与旋律条件生成。
OpenAI 开源的语音识别模型,跨 99 种语言,鲁棒性与准确率达到业界标杆,是本地语音转文字的主流选择。
Genmo 发布的开放权重视频生成模型,10B 参数,在开源视频模型中质量领先,可本地部署。
Stability AI 发布的开源文生图模型,带起整个开源 AI 绘画生态,可本地部署并衍生海量社区模型。
共 444 个 AI 模型
Aitishiku.com