AI MODELS DIRECTORY
AI 模型大全
收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型
Stability 开源 SD3.5,MMDiT 架构,文字渲染与多主题理解大幅提升,2B/8B 覆盖不同显存档位。
Stable Diffusion 1.5 是史上最流行的开源文生图模型,海量 LoRA 与模型生态,至今仍是社区主力。
阿里开源全模态模型 Qwen2.5-Omni,文本、图像、音频、视频实时理解与生成,端侧可跑,Apache-2.0 商用。
Stability 开源 Stable Fast 3D,单张图片 0.5 秒生成 3D 模型,快速高质量,本地可跑。
阿里开源文生图模型 Qwen-Image,20B MoE,中文理解与高质量写实出图,支持多图与编辑,国产开源强将。
Google 开源 PaliGemma,基于 Gemma 的视觉语言模型,3B 轻量,支持图文问答、检测与分割,端侧友好。
微软 Florence-2 统一视觉模型,用文本指令完成检测、分割、描述、OCR 等任务,小体积高效,MIT 商用。
智谱开源 CogVLM 视觉语言模型,17B 参数在视觉问答与理解上表现优秀,中文图文理解强。
InternVL 是开源视觉语言模型,中文视觉问答与图文理解强,多尺寸覆盖,学术与商用皆可。
Suno 开源 TTS 模型 Bark,可生成多语种语音、音乐、音效与「非语言」声音,情绪表达丰富。
Fish Speech 开源多语言 TTS,15 秒音频即可克隆音色,中文效果好,社区热度高。
阿里开源语音生成模型 CosyVoice,零样本语音克隆、多语种支持,音色自然,Apache-2.0 可商用。
百度开源的 ERNIE-ViLG 文生图模型,基于 PaddlePaddle 生态,中文与国风生成能力好,研究友好。
PixArt-Σ 是高效的文生图 DiT 模型,低成本训练、高质量输出,支持 4K 分辨率,开源可商用。
快手开源可图 Kolors,14B 文生图模型,中文理解优秀、写实画质高,Apache-2.0 免费商用,可本地部署。
AnimateDiff 将文生图模型变成动画生成器,对 Stable Diffusion 生态无缝兼容,可本地生成高质量短视频。
Lightricks 开源文生视频模型 LTX-Video,DiT 架构,低延迟生成,13B 高质量版本,消费级显卡可跑。
腾讯开源文生视频大模型 HunyuanVideo,13B 参数生成高分辨率视频,中文语义理解与运动质量优秀。
智谱开源文生视频模型 CogVideoX,2B/5B 参数本地可跑,中文提示词友好,是国产开源视频生成代表。
Stability AI 开源的音乐与音效生成模型,根据文本生成音频片段、旋律与音效,可本地运行,适合研究与音乐创作。
共 132 个 AI 模型
Aitishiku.com