AI MODELS DIRECTORY

AI 模型大全

收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型

全部 132 开源模型 107 闭源大模型·国内 90 闭源大模型·海外 80 本地部署模型 35 多模态模型 132
Stable Diffusion 3.5
Stability AI
开源·多模态

Stability 开源 SD3.5,MMDiT 架构,文字渲染与多主题理解大幅提升,2B/8B 覆盖不同显存档位。

参数:2B / 8B 上下文:文生图 👁 2
Stable Diffusion 1.5
Stability AI
开源·多模态

Stable Diffusion 1.5 是史上最流行的开源文生图模型,海量 LoRA 与模型生态,至今仍是社区主力。

参数:0.98B 上下文:文生图 👁 2
Qwen2.5-Omni
阿里巴巴
开源·多模态 国内

阿里开源全模态模型 Qwen2.5-Omni,文本、图像、音频、视频实时理解与生成,端侧可跑,Apache-2.0 商用。

参数:约 30B 上下文:全模态 👁 7
Stable Fast 3D
Stability AI
开源·多模态

Stability 开源 Stable Fast 3D,单张图片 0.5 秒生成 3D 模型,快速高质量,本地可跑。

参数:~1B 上下文:图生 3D 👁 5
Qwen-Image(阿里开源文生图)
阿里巴巴
开源·多模态 国内

阿里开源文生图模型 Qwen-Image,20B MoE,中文理解与高质量写实出图,支持多图与编辑,国产开源强将。

参数:20B(MoE) 上下文:文生图 👁 5
PaliGemma(Google 视觉)
Google
开源·多模态

Google 开源 PaliGemma,基于 Gemma 的视觉语言模型,3B 轻量,支持图文问答、检测与分割,端侧友好。

参数:3B 上下文:图文理解 👁 5
Florence-2(微软视觉)
Microsoft
开源·多模态

微软 Florence-2 统一视觉模型,用文本指令完成检测、分割、描述、OCR 等任务,小体积高效,MIT 商用。

参数:0.23B / 0.77B 上下文:视觉任务统一 👁 5
CogVLM(开源视觉)
智谱(THUDM)
开源·多模态 国内

智谱开源 CogVLM 视觉语言模型,17B 参数在视觉问答与理解上表现优秀,中文图文理解强。

参数:17B 上下文:图文理解 👁 6
InternVL(开源视觉)
上海人工智能实验室
开源·多模态

InternVL 是开源视觉语言模型,中文视觉问答与图文理解强,多尺寸覆盖,学术与商用皆可。

参数:2B ~ 40B 上下文:多模态长上下文 👁 7
Bark(开源 TTS)
Suno
开源·多模态 海外

Suno 开源 TTS 模型 Bark,可生成多语种语音、音乐、音效与「非语言」声音,情绪表达丰富。

参数:~1.2B 上下文:文本转语音+音乐 👁 4
Fish Speech(开源 TTS)
Fish Audio
开源·多模态 国内

Fish Speech 开源多语言 TTS,15 秒音频即可克隆音色,中文效果好,社区热度高。

参数:1B 上下文:文本转语音 👁 5
CosyVoice(阿里开源 TTS)
阿里(FunAudioLLM)
开源·多模态 国内

阿里开源语音生成模型 CosyVoice,零样本语音克隆、多语种支持,音色自然,Apache-2.0 可商用。

参数:约 2B 上下文:文本转语音 👁 7
ERNIE-ViLG(百度开源)
百度
开源·多模态 国内

百度开源的 ERNIE-ViLG 文生图模型,基于 PaddlePaddle 生态,中文与国风生成能力好,研究友好。

参数:图像模型(~2B) 上下文:文生图 👁 4
PixArt(开源文生图)
PixArt 团队
开源·多模态

PixArt-Σ 是高效的文生图 DiT 模型,低成本训练、高质量输出,支持 4K 分辨率,开源可商用。

参数:600M(DiT) 上下文:文生图 👁 3
Kolors(可图,快手开源)
快手
开源·多模态 国内

快手开源可图 Kolors,14B 文生图模型,中文理解优秀、写实画质高,Apache-2.0 免费商用,可本地部署。

参数:14B 上下文:文生图 👁 3
AnimateDiff(动画)
AnimateDiff 社区
开源·多模态

AnimateDiff 将文生图模型变成动画生成器,对 Stable Diffusion 生态无缝兼容,可本地生成高质量短视频。

参数:图像模型插件(1.5B 级) 上下文:图生动画 👁 5
LTX-Video(开源)
Lightricks
开源·多模态 海外

Lightricks 开源文生视频模型 LTX-Video,DiT 架构,低延迟生成,13B 高质量版本,消费级显卡可跑。

参数:2B / 13B 上下文:文生视频 👁 8
HunyuanVideo(腾讯开源)
腾讯
开源·多模态 国内

腾讯开源文生视频大模型 HunyuanVideo,13B 参数生成高分辨率视频,中文语义理解与运动质量优秀。

参数:130亿参数 上下文:文生视频 👁 5
CogVideoX(智谱开源)
智谱AI(THUDM)
开源·多模态 国内

智谱开源文生视频模型 CogVideoX,2B/5B 参数本地可跑,中文提示词友好,是国产开源视频生成代表。

参数:2B / 5B 上下文:文生视频 👁 11
Stable Audio(音频生成)
Stability AI
开源·多模态 海外

Stability AI 开源的音乐与音效生成模型,根据文本生成音频片段、旋律与音效,可本地运行,适合研究与音乐创作。

参数:1.1B / 2.1B 上下文:文本生成音频 👁 5

共 132 个 AI 模型