AI MODELS DIRECTORY

AI 模型大全

收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型

全部 444 开源模型 107 闭源大模型·国内 90 闭源大模型·海外 80 本地部署模型 35 多模态模型 132
Tripo 3D
VAST
多模态 海外

VAST 的 Tripo 系列 3D 生成模型,文本或图像生成 3D 网格,速度达到分钟级,主打游戏与设计资产生成。

参数:闭源(未公开) 👁 5
Cartesia
Cartesia
多模态 海外

Cartesia 的云端语音 API,基于其低延迟 Sonic 引擎,面向实时语音产品。

参数:闭源(未公开) 👁 4
讯飞语音合成
科大讯飞
多模态 国内

科大讯飞的在线语音合成服务,中文音色业界领先,覆盖上百种音色与方言。

参数:闭源(未公开) 👁 4
TTS-1
OpenAI
多模态 海外

OpenAI 的官方文本转语音模型,支持多种音色和输出格式,是 TTS-1-hd 的基础版本。

参数:闭源(未公开) 👁 4
Flutter TTS
字节跳动
多模态 国内

字节跳动的拟人语音合成模型,中文发音自然,用于火山引擎 TTS 服务。

参数:闭源(未公开) 👁 4
Suno V4
Suno
多模态 海外

Suno 第四代音乐生成模型,支持带人声的完整歌曲创作,风格覆盖流行、民谣、电子等,是当下的音乐 AI 标杆。

参数:闭源(未公开) 👁 4
ElevenLabs V3
ElevenLabs
多模态 海外

ElevenLabs 第三大语音模型,在语音逼真度与可控性上再次升级,支持强化语音与多风格。

参数:闭源(未公开) 👁 6
ElevenLabs V2
ElevenLabs
多模态 海外

ElevenLabs 第二代语音合成引擎,合成语音极其接近真人,支持多语言与情感表达,是第一梯队的 TTS 服务。

参数:闭源(未公开) 👁 5
GPT-4o Audio
OpenAI
多模态 海外

GPT-4o 的原生音频能力,实现接近实时的语音对话,理解语气与情感,是 Agent 与语音助手的新范式。

参数:闭源(未公开) 👁 5
混元 3D
腾讯
多模态 国内

腾讯混元 3D 模型,支持文本或图像生成 3D 模型,面向建模与游戏美术场景,开放平台可直接使用。

参数:闭源(未公开) 👁 4
可灵 3D
快手
多模态 国内

快手可灵的三维生成能力,可从单张图像生成 3D 模型,服务游戏与设计行业。

参数:闭源(未公开) 👁 4
Haiper
Haiper
多模态 海外

Haiper 的视频生成模型,从图生视频起家,提供专业的视频创作工具,支持多模态输入。

参数:闭源(未公开) 👁 4
Genmo
Genmo
多模态 海外

Genmo 的视频创作平台,提供 Mochi 系列模型的云端生成体验。

参数:闭源(未公开) 👁 5
Luma Ray2
Luma AI
多模态 海外

Luma AI 的视频生成模型,主打真实感与相机运动质感,曾爆火的“黏土/Sora 风格”均出自其 Hallucination 模型。

参数:闭源(未公开) 👁 4
Runway Gen-2
Runway
多模态 海外

Runway 第二代视频生成模型,是商用文生视频的早期代表,开创了文本/图像转视频的创作工具。

参数:闭源(未公开) 👁 4
Veo 2
Google
多模态 海外

Google DeepMind 的旗舰视频生成模型,支持最高 8 秒 1080p 视频,物理运动与镜头语言逼真。

参数:闭源(未公开) 👁 4
Sora 2
OpenAI
多模态 海外

OpenAI 新一代视频生成模型,在物理一致性、角色一致性与多镜头叙事上大幅提升,可通过 Sora 订阅放平台使用。

参数:闭源(未公开) 👁 4
Krea
Krea
多模态 海外

Krea 的实时图像生成与增强平台模型,主打“边画边生成”的实时反馈与放大增强功能。

参数:闭源(未公开) 👁 4
Playground
Playground AI
多模态 海外

Playground V3 是基于 Flux 训练的专用文生图模型,主打设计行业的高质量图像与易于使用。

参数:闭源(未公开) 👁 5
Seedream 3
字节跳动
多模态 海外

字节 Seedream 系列文生图模型,支持文生图、图生图与精细编辑,中文提示词理解优秀。

参数:闭源(未公开) 👁 4

共 444 个 AI 模型