AI MODELS DIRECTORY
AI 模型大全
收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型
Stability AI 的高分辨率文生图模型,图像质量与细节较 SD 1.5 大幅提升,生态最成熟(LoRA/ControlNet 海量),本地可免费商用。
深度求索开源的多模态大模型,MoE 架构高效推理,在文档图表理解、OCR 与视觉问答上表现优秀,中文与视觉结合能力强。
Meta 开源的音乐生成模型,输入描述与风格可生成带旋律/伴奏的音频片段,支持文本/旋律双提示,本地可运行,研究友好。
Stability AI 开源的图像生成视频模型,输入一张图片即可生成短视频,研究友好,可与 Stable Diffusion 生态结合做动态内容。
OpenAI 开源的语音识别模型,支持 99 种语言的转写与翻译,含弱监督多语言训练,可本地运行,是主流开源 ASR 方案,社区优化版更快。
阿里通义实验室开源的视频生成模型 Wan2.1,支持文生视频、图生视频与视频编辑,Apache-2.0 开源,云端也提供「万象」视频生成服务。
Black Forest Labs(原 Stable Diffusion 团队)推出的文生图模型,直出图质量与文字渲染、人手细节业界领先,Schnell 版开源、dev 版本也开放权重。
面壁智能推出的端侧多模态模型,8B 参数即可在手机/消费级显卡上运行,支持图像、视频理解与 OCR,中文能力强。
最流行的开源文生图模型,SD 3 采用扩散 Transformer 架构,文字渲染与人体结构显著提升,可通过 Diffusers 或 ComfyUI 本地生成高质量图像。
OpenAI 开源的图文对齐模型,将图片与文本映射到同一向量空间,可用于以文搜图、图搜图、图像分类与多模态检索系统。
开源视觉指令跟随模型的开山之作,架构简洁(视觉编码器+LLM),在图像问答、描述与推理上表现出色,生态与衍生模型众多。
通义千问开源视觉语言模型,支持图像理解、视频理解与视觉定位,72B 版本能力对标闭源多模态旗舰,Apache-2.0 可商用。
Deemos 的 Rodin 3D 模型生成器,专业面向角色模型与游戏美术,生成质量在 3D 社区广受好评。
VAST 的 Tripo 系列 3D 生成模型,文本或图像生成 3D 网格,速度达到分钟级,主打游戏与设计资产生成。
Cartesia 的云端语音 API,基于其低延迟 Sonic 引擎,面向实时语音产品。
科大讯飞的在线语音合成服务,中文音色业界领先,覆盖上百种音色与方言。
OpenAI 的官方文本转语音模型,支持多种音色和输出格式,是 TTS-1-hd 的基础版本。
字节跳动的拟人语音合成模型,中文发音自然,用于火山引擎 TTS 服务。
Suno 第四代音乐生成模型,支持带人声的完整歌曲创作,风格覆盖流行、民谣、电子等,是当下的音乐 AI 标杆。
ElevenLabs 第三大语音模型,在语音逼真度与可控性上再次升级,支持强化语音与多风格。
共 132 个 AI 模型
Aitishiku.com