← 返回AI变现
🌐 其他

【AI】一文读懂大模型生态:分类/参数/结构/训练/GPU/评测/排行/社区

来源:掘金 · 发布于 2026-08-17 22:57:44
大模型指参数规模巨大、基于深度神经网络构建的人工智能模型。主要有语言模型,图像视频模型,语音模型,多模态模型(可以同时处理文本图像语音等)。本文主要描述大语言模型,即LLM(Large Languag

【AI】一文读懂大模型生态:分类/参数/结构/训练/GPU/评测/排行/社区

漂流瓶jz 2026-08-17 7 阅读20分钟

大模型介绍

简介

大模型指参数规模巨大、基于深度神经网络构建的人工智能模型。主要有语言模型,图像视频模型,语音模型,多模态模型(可以同时处理文本图像语音等)。本文主要描述大语言模型,即LLM(Large Language Model)。LLM大语言模型主要使用Transformer架构,在海量文本数据上进行训练,可以理解和生成自然语言。

LLM本质是有一个词表,其中的每个词叫做token,用向量的形式表示,向量之间的关系就是词之间的关系(注意力权重)。将输入的文本编码为高维向量,通过深度神经网络找到上下文关系,最终通过预测下一个词的概率来生成文本。

能力

虽然仅仅是通过预测和生成文本,但是得益于算法和海量数据所带来的能力,大语言模型可以做到:

  • 理解和推理,实现数学运算,逻辑证明等
  • 生成和创作各种类型的文章,论文,诗歌等
  • 理解文案内容再翻译
  • 编程,表格等能力,可以理解和输出特殊格式的文字

通过在Agent等外部工具中使用,可以扩展大模型的能力,使得大模型具有浏览网页,读取编辑文件,执行命令等功能。实际上还是通过文本来实现。下面是简化的调用流程,实际很多场景要更复杂。

  1. Agent通过提示词告诉大模型有xx能力,可以通过xx指令调用(指令也是文本)
  2. 大模型在适当时机输出指令,告诉Agent调用xx能力。
  3. Agent调用能力,并返回结果给大模型。
  4. 例如访问网页,实际上是Agent访问网页,将网页内容返回给大模型解析。

llm-stru-1.png

多轮对话能力:大模型本质上是不能记住信息的,每次用户输入的文本,它都当做是一次全新的对话来回答。那么大模型是如何实现多轮对话的能力呢?也需要外部工具的帮助。工具将每轮对话的问题和回答记录下来,当用户问问题时,工具将前面的问题和回答也都提供给大模型,组成一串很长的文本。这样大模型可以看到之前的对话,也就可以理解上下文并做出相应回答了。

分类和厂商

大模型的分类有很多类型,这里一一列举下:

  • 以模态分类
    • 语言模型:仅支持文本的理解和生成
    • 多模态模型:除文本外,还支持图片或视频或声音等的理解或生成
    • 图片生成模型:文生图/图生图模型
    • 视频生成模型:文生视频/图生视频/视频生视频等模型
    • 全模态模型:支持文本/图片/视频/声音等全部模态的理解和生成
  • 以参数激活模式分类
    • 稠密模型:每次处理时所有参数都参与运算
    • 稀疏模型:处理时仅部分参数参与运算
    • 混合专家模型(MoE):稀疏模型中的主流用法,模型中包含很多专家子网络。每次处理时仅部分专家参与运算
  • 以开源分类
    • 闭源模型:模型所有内容都不公开
    • 开放权重模型:公开模型训练后的权重文件,使用者可以自行部署调用模型

其中开放权重模型更像是将模型做完后的成果开源,并不是开放模型的训练代码本身。用户下载了权重文件后,只能自己部署和调用。有些厂商还会开放训练方法和代码,但由于需要性能非常强大的服务器,以及需要海量的数据,复现一个类似模型是非常困难的。

世界范围内有很多厂商在开发大模型,其中以美国和中国为主。这里列举了部分排名前列的模型厂商。

国家厂商名字模型系列大模型为主业
美国OpenAIGPT是
美国AnthropicClaude是
美国GoogleGemini否
美国xAI(SpaceX)Grok否
中国深度求索DeepSeek是
中国月之暗面Kimi是
中国阿里巴巴Qwen千问否
中国智谱GLM是
中国字节跳动Seed(豆包, Seedance, Seedream)否
中国稀宇科技MiniMax是
中国小米MiMo否
中国美团LongCat龙猫否

参数和推理流程

重要参数

市场上的大模型在描述中都提供了一些参数值,例如参数量,上下文长度,数值编码精度等,这里简单解释一下这些参数的含义。

参数含义举例
参数量模型一共可以调节的参数数量,B表示Billion,即十亿70B 200B 2T
上下文长度一次输入+输出的所有token总数128K 1M
数值编码精度每个参数的编码规范和存储位数(整数/浮点数,4位/8位/16位等)FP16 INT8 MXFP4
层数Transformer层的数量,数据会一次经过每一层处理80层 100层
词表字/词与token编码的对应关系表"你好" "hi"
向量维度每个token对应的特征向量的维度(长度),每个维度代表一种语义1024维 5120维

其中上下文长度虽然指的是“一次输入+输出的”token总数,但要注意前面提到过大模型没有记忆功能,我们提到的前面的问题和回答是会随着新问题一起发送给大模型的。因此多轮对话越长,每次发给大模型的token越多,当多轮对话中的所有token加起来超过token总数时,也就超过了上下文长度。

为了简单起见,这里和后续我们都选择Qwen3-0.6B为例来描述。这是一个开放权重模型,参数量级比较小的稠密语言模型。这个模型在大部分普通电脑中都能运行起来,非常适合作为学习使用。这里首先看一下它的参数值:

参数值
参数量0.6B
上下文长度32K
数值编码精度BF16
层数28层
词表151936(支持上百种语言)
向量维度1024维

模型推理流程

大模型分为训练和推理两个过程。简单理解下,训练可以看作是创造这个模型的过程;推理则是使用创建好的模型,让它回答问题的过程。这里我们顺着前面的介绍,使用Qwen3-0.6B为例,简要描述一下模型的推理流程。

llm-stru-2.png

  1. 首先用户输入问题文本。被分词器切分成token序列。分词器切分和转换token是按照预设的词表进行。
  2. 每个token被转换为对应的向量,每个向量是1024维。token序列就变成了向量序列。
  3. 将向量序列输入进第一层网络中,开始计算。
  4. 第一层网络得到的结果被输入第二层网络计算,输出再依次通过后续网络,直到第28层。
  5. 使用结果预测得到一个新的token,放入前面的token序列中作为最后一个元素。
  6. 重复第2到5个步骤,直到生成结束。
  7. 将token序列转换回文本,输出给用户。

通过上面的流程描述,我们可以看到几个关键点:

  • 将文本转换为数据的方式是分词器和token,最终在模型计算中以向量表示
  • 模型每次只能预测一个词,再预测下一个词时,需要重新通过所有层计算
  • 每一层都会将之前计算过的向量结果缓存下来,只有预测的新词需要重新计算,避免重复计算消耗性能

参数量组成

前面了解模型推理过程之后,有些同学心中会有一个问题,即为什么模型的数据量这么大。这里我们将0.6B的参数量拆开,看看究竟是怎么组成的。

  • 词嵌入 即每个token对应的初始向量,词表中的每个词都有初始向量。即 151,936 × 1,024 = 155,582,464
  • 单个Transformer层中,Q/K/V/O投影矩阵分别为 1024 × 1024 × 2 + 1024 × 2048 × 2 = 6,291,456
  • 单个Transformer层中,前馈网络的参数为 1024 × 3072 × 3 = 9,437,184
  • 每层的参数量为 9,437,184 + 6,291,456 = 15,728,640 (省略了部分很少的参数)
  • 所有层的参数总量为 15,728,640 × 28 = 440,401,920
  • 模型总参数为 155,582,464 + 440,401,920 = 595,984,384 ≈ 596M = 0.6B

llm-stru-3.png

从模型参数量的拆解中,可以看到影响模型参数量大小的最重要的几个点:词表大小,向量维度,层数。还有每层的结构也会影响,但这篇文章中并不讨论模型结构细节。尤其是向量维度的增长对模型参数量大小的影响是平方级别的。

例如我们将向量维度*5 = 5120,层数变为64层,提升之后正是Qwen3-32B的参数。那么模型Transformer层的数据量可以简单推算为 0.44B * 5^2 * 64 / 28 ≈ 25B。模型中部分参数量并不严格按照平方计算,因此和实际参数量有差距,但大致是符合参数量级的。

训练和GPU

训练方式

训练是创造大模型的过程,其中主要分为两个步骤:先进行预训练,再进行后训练。预训练是使用巨量的各种领域的文本来让模型学习语言和知识。这一阶段数据量非常大,计算量也很高。预训练结束后,词嵌入(即每个token对应的初始向量)和所有层的参数值都已经填充完成了,理论上来说,它已经是一个成型的模型格式和数据了。但是它只会续写文本,基本无法正常对话。

后训练是对预训练后的参数进行调整。它接收问题答案成对格式的数据,通过学习学会对话问答的形式以及指令形式,也就是SFT。还有其它强化学习等也可以调整参数。

GPU参数

大模型的训练和推理放到GPU中进行,因此需要GPU的算力进行计算,GPU中的显存(即GPU内存)用来存放模型本身和训练数据。CPU和内存也能进行计算,但由于原理不同,计算速度非常慢。这里首先介绍一下GPU中的部分参数含义和概念:

  • 计算能力 表示GPU计算能力的数值,注意同一个GPU,不同精度数字的运算能力不同,例如FP32, FP16等,精度越小计算能力越强。
    • FLOPS 每秒浮点数的运算次数
    • TFLOPS 每秒10^12次运算 PFLOPS 每秒10^15次运算
  • 显存类型 在内存芯片设计上的区别
    • GDDR 普通家用显存
    • HBM 使用3D堆叠技术,高性能计算卡使用 HBM3e > HBM3
  • 显存带宽 GPU计算核心和显存之间的数据传输速度

大模型的GPU要求

如何判断大模型需要的GPU要求呢?这里我们根据大模型参数量,给出一个粗略的计算公式,注意这里仅适用于稠密模型。首先是计算能力需求。其中训练token数量采用Qwen3的预训练36T,后训练一般没有这么多。推理token数量采用每秒30个token。

  • 训练(预训练后训练类似) 6 * 模型参数量 * 训练token数量
    • 以Qwen3-0.6B为例 6 * 0.6B * 36T ≈ 1.3 × 10^23 FLOP = 1.3 × 10^11 TFLOPS
    • 以Qwen3-32B为例 6 * 32B * 36T ≈ 6.9 × 10^25 FLOP = 6.9 × 10^13 TFLOPS
  • 推理 2 * 模型参数量 * token数量
    • 以Qwen3-0.6B为例 2 * 0.6B * 30 ≈ 3.6 × 10^10 FLOPs = 0.036 TFLOPS
    • 以Qwen3-32B为例 2 * 32B * 30 ≈ 1.9 × 10^12 FLOPs = 1.9 TFLOPS

可以看到,训练和推理所需的计算性能相差很大。然后再看下对于显存的要求。注意显存要求是和模型数值精度位数有直接关系的,例如16位相比8位,显存需求一般要大一倍。下面的公式中我们以BF16,即16位两字节来计算。

  • 训练(预训练后训练类似) 8 * 模型参数量 * 2
    • 以Qwen3-0.6B为例 8 * 0.6B * 2 ≈ 9.6 × 10^9 字节 = 9.6GB
    • 以Qwen3-32B为例 8 * 32B * 2 ≈ 5.12 × 10^11 字节 = 512GB
  • 推理 显存主要分为两部分:模型参数量 * 2 + KV Cache
    • 加载模型本身 模型参数量 * 2
    • KV Cache 即前面推理流程中提到的 每层都会将之前计算过的向量结果缓存下来
      • 输入的上下文大小越长,缓存越大
      • 一个token的缓存大小,大小与模型结构和层数有关
    • 以Qwen3-0.6B为例 1token的KV Cache缓存约为 4KB * 28层 = 112KB
      • 上下文1K时 0.6B * 2 + 1K * 112K ≈ 1.2 GB + 112MB ≈ 1.3GB
      • 上下文32K时(最大上下文) 0.6B * 2 + 32K * 112K ≈ 1.2 GB + 3.8GB ≈ 5GB
    • 以Qwen3-32B为例 1token的KV Cache缓存约为 4KB * 64层 = 256KB
      • 上下文1K时 32B * 2 + 1K * 256K ≈ 64 GB + 256 MB ≈ 64GB
      • 上下文32K时(最大上下文) 32B * 2 + 32K * 256K ≈ 64GB + 8.6GB ≈ 72.6GB

可以看到对于小模型来说,上下文越大,缓存占用的显存也就越大,甚至远大于模型本身的显存要求。但是模型参数量增大后,缓存增长却没有那么快,在超大模型中缓存的占比就非常小了。另外这是保守估计的计算值,实际上因为一些额外计算,额外程序和数据存储等,计算量和显存使用量都会更大。

另外显存与计算能力不一样的点在于,计算能力即使差一点也可以用,就是运行得慢一点。但显存是个硬指标,如果不符合要求,模型会无法启动,这时候一点工作都不能完成。从这个角度看,训练模型的硬性条件是很高的。

GPU市场

上面了解了模型对于GPU的要求之后,我们来看一下市场上的GPU有哪些,都提供了怎样的性能。这里分为国外GPU和国内GPU分别介绍。首先是国外GPU:

国家厂商型号BF16稠密算力峰值显存大小显存类型显存带宽发布时间
美国NVIDIAH100989 TFLOPS80GBHBM33.4 TB/s2022
美国NVIDIAH200989 TFLOPS141GBHBM3e4.9 TB/s2024
美国NVIDIAB2002250 TFLOPS192GBHBM3e8 TB/s2024
美国NVIDIAB3003750 TFLOPS288GBHBM3e8 TB/s2024
美国NVIDIAH20 (中国特供)148 TFLOPS96GBHBM34 TB/s2024
美国AMDMI300X1307 TFLOPS192 GBHBM35.3 TB/s2023
美国AMDMI325X1307 TFLOPS256 GBHBM3e6.1 TB/s2024
美国AMDMI350X2306 TFLOPS288 GBHBM3e8.2 TB/s2025
美国AMDMI355X2516 TFLOPS288 GBHBM3e8.2 TB/s2025

有些厂商还提供了整个机柜的全套方案,例如下面列出两个NVIDIA的方案,内部包含72颗GPU芯片,GPU和CPU集成在一起,即B200集成后为GB200,B300集成后为GB300。

国家厂商型号BF16稠密算力峰值显存大小
美国NVIDIAGB200 NVL72180000 TFLOPS13.4TB
美国NVIDIAGB300 NVL72360000 TFLOPS20TB

除了NVIDIA和AMD之外,Google,Amazon等厂商也在推出GPU,但是市场份额较少。最后列一下家用的顶级显卡5090和常见的苹果M4芯片的参数做对比:

国家厂商型号BF16稠密算力峰值显存大小显存类型显存带宽发布时间
美国NVIDIARTX5090419 TFLOPS32GBGDDR71.8 TB/s2025
美国AppleM413 TFLOPS使用电脑的统一内存LPDDR5X120 GB/s2024

评测

现在基本上每个大模型发布之时,都会附带一些测试分数,还会与其它大模型比较分数高低。这些测试是什么,有什么作用?这里我们以DeepSeek-V4-Pro-0813报告中的部分测试为例,简单看一下这些评测内容。

HLE

HLE(Humanity's Last Exam)翻译为中文叫作“人类最后的测试”。包含2,500个问题,涉及数十个学科,包括数学、人文学科和自然科学。它由全球各领域的专家编写,包含适合自动评分的选择题和简答题。题目和对应翻译举例如下:

llm-stru-4.png

Terminal Bench

Terminal Bench是一个评估大模型在Agent中,使用命令行完成任务的测试。其中大部分是计算机编程相关任务,包含编译/调试/运行代码,配置服务,处理数据等。它分为很多个测试版本,例如1.0, 2.0, 2.1, 3.0等。如下图有两个任务,左侧是从源码构建出Linux操作系统内核,右侧是使用git提交代码并启动本地HTTP服务。

llm-stru-5.png

NL2Repo

NL2Repo是字节跳动提出的一个评估模型在编程Agent中执行长周期任务性能的测试,这些任务要求从零开始生成一个完整可运行的代码库。测试包含104个不同的任务,每个任务都配有独立的测试环境。test_files目录中包含全部任务数据,每个任务中包含四个文件。

  • start.md 任务的需求描述文档
  • test_case_count.txt 该任务包含的测试用例总数,通常只是一个数字
  • test_commands.json 定义如何运行测试的具体命令行指令
  • test_files.json 测试所需的外部数据或文件清单

题目的start.md部分内容和对应翻译举例如下:

llm-stru-6.png

CyberGym

CyberGym是用于大规模评估模型在Agent中对真实世界网络安全漏洞实战能力的测试。它包含三种测试形式:

测试名称测试内容测试例子数量
CyberGym漏洞复现1507个漏洞/188个项目
ExploitGym利用漏洞攻击869个漏洞
CyberGym-E2E漏洞修复920个漏洞/139个项目

排行

在大模型发布时,除了前面的评测外,网络上还会有一些排行,表示大模型各种能力的高低,有些排行本身就是用数据评测出的,有些则是单纯的排行榜。

Artificial Analysis

Artificial Analysis是一个大模型排行和分析平台,里面包含了各种各样的排行榜,包括AI智能排行,速度排行,成本排行,图像/视频排行等。它最主要的智能指数(Artificial Analysis Intelligence Index)是由很多种评测得分加权形成的,其中包含外部评测(例如SciCode, GPQA Diamond, 还有前面介绍过的HLE, Terminal-Bench等),也包含一些平台自己的评测。截至文章撰写时排行如下:

llm-stru-7.png

Arena

Arena是一个大模型排行平台,里面也包含很多榜单,包括对话榜,Agent榜,前端开发榜等等。这些榜单并不是通过数据评测得分排行,而是通过用户真实的体验感受得出。用户使用AI时,Arena会同时提供两个匿名模型的结果,用户投票选出更好的一方。然后通过Elo评分系统最终得出排名。Elo评分系统是广泛使用的评分机制,像是篮球、乒乓球、围棋、游戏等,都采用这个评分机制对运动员进行排名。例如下面是这个平台的前端代码能力排行:

llm-stru-8.png

其它站点

Hugging Face

Hugging Face的中文名叫做抱抱脸,是一个人工智能社区平台。它主要由两部分组成,这两部分的使用者都非常广泛:

  • 大模型和数据集的上传/下载/分享平台。目前有超过200万个模型和50万个数据集
  • 以Transformers为主的大模型的开源训练推理工具库,可通过少量代码快速实现功能

Hugging Face在国内无法访问,但是有对应的国内镜像站。国内还有一个类似的网站叫做魔搭社区,是阿里创办的大模型平台。

OpenRouter

OpenRouter是一个大模型API聚合平台。在不用OpenRouter时,我们使用哪个大模型,就要去对应厂商的网站中充钱,获取一个单独的API地址和key。如果想体验不同的模型,就比较麻烦。OpenRouter和这些大模型厂商都谈好了合作,我们只需要接入OpenRouter的API,在这里面充值一次,就可以一键切换使用不同的模型。

OpenRouter会公布不同模型在平台的调用数据,因为OpenRouter的访问量比较大,因此这个数据经常被用来比较模型的受欢迎程度,例如这是文章撰写时最近一周的模型调用量排名:

llm-stru-9.png

参考