AI MODELS DIRECTORY
AI 模型大全
收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型
VAST 的 Tripo 系列 3D 生成模型,文本或图像生成 3D 网格,速度达到分钟级,主打游戏与设计资产生成。
Cartesia 的云端语音 API,基于其低延迟 Sonic 引擎,面向实时语音产品。
科大讯飞的在线语音合成服务,中文音色业界领先,覆盖上百种音色与方言。
OpenAI 的官方文本转语音模型,支持多种音色和输出格式,是 TTS-1-hd 的基础版本。
字节跳动的拟人语音合成模型,中文发音自然,用于火山引擎 TTS 服务。
Suno 第四代音乐生成模型,支持带人声的完整歌曲创作,风格覆盖流行、民谣、电子等,是当下的音乐 AI 标杆。
ElevenLabs 第三大语音模型,在语音逼真度与可控性上再次升级,支持强化语音与多风格。
ElevenLabs 第二代语音合成引擎,合成语音极其接近真人,支持多语言与情感表达,是第一梯队的 TTS 服务。
GPT-4o 的原生音频能力,实现接近实时的语音对话,理解语气与情感,是 Agent 与语音助手的新范式。
腾讯混元 3D 模型,支持文本或图像生成 3D 模型,面向建模与游戏美术场景,开放平台可直接使用。
快手可灵的三维生成能力,可从单张图像生成 3D 模型,服务游戏与设计行业。
Haiper 的视频生成模型,从图生视频起家,提供专业的视频创作工具,支持多模态输入。
Genmo 的视频创作平台,提供 Mochi 系列模型的云端生成体验。
Luma AI 的视频生成模型,主打真实感与相机运动质感,曾爆火的“黏土/Sora 风格”均出自其 Hallucination 模型。
Runway 第二代视频生成模型,是商用文生视频的早期代表,开创了文本/图像转视频的创作工具。
Google DeepMind 的旗舰视频生成模型,支持最高 8 秒 1080p 视频,物理运动与镜头语言逼真。
OpenAI 新一代视频生成模型,在物理一致性、角色一致性与多镜头叙事上大幅提升,可通过 Sora 订阅放平台使用。
Krea 的实时图像生成与增强平台模型,主打“边画边生成”的实时反馈与放大增强功能。
Playground V3 是基于 Flux 训练的专用文生图模型,主打设计行业的高质量图像与易于使用。
字节 Seedream 系列文生图模型,支持文生图、图生图与精细编辑,中文提示词理解优秀。
共 444 个 AI 模型
Aitishiku.com