← 返回AI变现
🌐 其他

阿里云PAI发布通用蒸馏框架EasyDistill2.0,提供主流大模型蒸馏场景最佳实践

来源:掘金 · 发布于 2026-08-19 14:01:28
2025 年,阿里云人工智能平台 PAI 开源了大模型蒸馏框架 EasyDistill,并陆续发布了 DistilQwen 系列蒸馏模型。

阿里云PAI发布通用蒸馏框架EasyDistill2.0,提供主流大模型蒸馏场景最佳实践

阿里云大数据AI技术 2026-08-19 0 阅读21分钟

前言

模型能力迭代与企业落地之间的张力正在加剧:更长的思维链、更深度的工具调用、更复杂的多模态理解不断涌现,而企业真正关心的是如何以可接受的成本,在自有环境中稳定、规模化地复现这些能力。知识蒸馏是破解这一张力的关键工程范式:它不是简单的模型压缩,而是以数据合成为核心的能力迁移机制。教师模型通过生成高质量数据、展示完整推理过程,把已习得的能力迁移给学生模型。

数据合成能力决定了蒸馏的天花板:它不仅需要规模化地产出样本,还要保证多样性、难度分布、质量一致性与可追溯性。2025 年,阿里云人工智能平台 PAI 开源了大模型蒸馏框架 EasyDistill(developer.aliyun.com/article/166… 并陆续发布了 DistilQwen 系列蒸馏模型。在服务内外部客户的过程中,我们注意到一个明确的变化:蒸馏落地的瓶颈,正从训练算法转移到训练数据的规模化生产。客户反复遇到三类问题:

  • 有教师,没链路

    能调用强大的教师模型 API,但缺乏把教师输出系统性转化为训练数据的工具链,生产依赖一次性脚本,流程难以复用。

  • 场景碎片化

    蒸馏需求已扩展到多模态理解、Agent 工具调用、自动 Prompt 工程等领域,每个场景单独搭流程,维护成本线性增长。

  • 格式转换成本

    数据要接入 LLaMA-Factory、ms-swift、transformers 等训练框架,通常需要额外写转换脚本;转换错误难察觉,且缺乏溯源信息。

为此,我们推出 EasyDistill2.0 (github.com/modelscope/… 相比第一代“蒸馏工具包”的定位,EasyDistill2.0 被重新设计为一座配置驱动的数据生产工厂:一份 YAML 配置即可串联数据合成、教师生成、质量评估、过滤改写与数据集导出,产出可直接投入 SFT 与 DPO 训练的数据集。

核心升级:从“怎么蒸”到“怎么规模化生产训练资产”

第一代 EasyDistill 回答的是“怎么蒸”,提供基础蒸馏算法与训练脚本;第二代回答的是“怎么规模化地把教师模型的能力转化为训练资产”。具体变化体现在四个维度:

维度EasyDistillEasyDistill2.0
定位蒸馏工具包配置驱动的数据生产工厂
流程组织脚本驱动,易成为一次性工程YAML 流水线,可复现、可续跑、可审计
场景覆盖以指令蒸馏为主指令、CoT、多模态、Agent、AIGC 图/视频、PE 改写等多种场景
数据产出需手动转换格式输出训练就绪的数据集 + 溯源元数据

概括而言,EasyDistill 2 把六大蒸馏场景收敛到同一套工程范式。

框架设计:配置即流水线,数据即资产

三层架构

EasyDistill2.0 采用后端层、算子层、流水线层的三层架构:

4e91324912a04da4aae7f14488ad0646.png

  • 后端层(Backends)

所有教师模型调用统一收敛到 ModelBackend 抽象,支持三类后端:任意 OpenAI 兼容端点(openai)、阿里云 PAI-Token 服务(pai_token)、PAI-EAS 自部署模型(pai_eas)。CLI 启动时会先做后端健康检查,凭据失效或端点配置错误在流水线执行前即被拦截,避免长任务中途失败造成 API 费用浪费。

  • 算子层(Operators)

生成、评估、过滤、改写、平衡、偏好评分等能力全部实现为原子算子,包括指令扩充(instruction_expansion)、指令平衡(instruction_balance)、LLM-as-judge 评估、CoT 长短改写(cot_long2short / cot_short2long)、RV/CD 课程混合、偏好对构造等。每个算子同时以独立 job_type 透出,支持单步调试;某一步出错时,可从上一步落盘的 JSONL 直接续跑。

  • 流水线层(Pipelines)

原子算子按场景组装为端到端流水线,每个阶段的中间结果固化为 JSONL 文件,并附带样本级元数据,整条链路可审计、可复现,任何一条训练样本都能回溯到具体的教师模型、调用记录与过滤路径。

统一 CLI 入口为:

easydistill --config <path_to_config.yaml>

一份配置描述完整数据流

以高级思维链蒸馏为例,一份 YAML 即可完整描述“生成 → 评分 → 混合 → 建库”四个阶段:

job_type: advanced_cot_distill

backend:
  type: pai_token
  model_id: kimi-k2.6

generation:
  system_prompt: "You are a helpful assistant. Think step by step and provide clear reasoning."
  temperature: 0.7
  max_tokens: 2048

pipeline:
  - stage: cot_distill
    output_path: outputs/cot_stage1_generated.jsonl
  - stage: cot_rvcd_score
    output_path: outputs/cot_stage2_scored.jsonl
  - stage: cot_mix_by_rv_cd
    config:
      cd_bins: [0, 3, 6, 10]
      rv_target: matched
    output_path: outputs/cot_stage3_mixed.jsonl
  - stage: build_sft

dataset:
  input_path: examples/seed_cot_problems.jsonl
  output_path: outputs/cot_sft_pai_token.jsonl

配置即说明了种子来源、处理阶段、每个阶段的产物位置与最终数据集路径。

训练就绪的数据格式

数据生产的最后一环往往消耗大量工程时间:格式不匹配、字段缺失、来源不明。EasyDistill 2 的所有 SFT 输出统一采用 OpenAI/ShareGPT messages 格式,且每条样本携带溯源元数据:

{
  "messages": [
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "What is 2+2?"},
    {"role": "assistant", "content": "4"}
  ],
  "metadata": {
    "source": "teacher_model",
    "model": "qwen2.5-72b-instruct",
    "request_id": "1",
    "backend": "pai_token",
    "usage": {"prompt_tokens": 31, "completion_tokens": 1, "total_tokens": 32}
  }
}

metadata 中的 source、model、backend、usage 字段使每条训练样本可追溯到具体的教师模型与单次 API 调用,数据审计有据可查,token 成本可核算到样本粒度。该格式无需转换即可在 LLaMA-Factory 中按 sharegpt 注册使用,或直接传给 ms-swift。

六大蒸馏场景

EasyDistill 2 将六种常见蒸馏需求收敛到同一套流水线范式:

场景流水线说明
指令蒸馏instruct_distill、advanced/balanced/augmented_instruct_distill从种子指令到类别均衡、裁判筛选后的 SFT 数据
思维链蒸馏cot_distill、advanced_cot_distillRV/CD 双指标课程混合,使 CoT 数据难度与学生模型能力匹配
多模态蒸馏mm_instruct_distill、mm_cot_distill 及 advanced 版本视觉语言指令与对应视觉 CoT 数据生产
Agent 蒸馏agent_distill从 persona 种子全自动合成多轮 Agent 工具调用轨迹
AIGC 文生图/视频蒸馏t2i_distill、t2v_distill从简短文本 prompt 到带图/视频的多模态 SFT 数据
Prompt Enhancer(PE)改写蒸馏pe_rewrite_distill把教师模型 Prompt 增强能力蒸馏给学生模型

指令蒸馏:从种子指令到均衡数据集

基础流程 instruct_distill 为种子指令生成教师回复并直接构建 SFT 数据;在此之上提供三条进阶流水线:

  • advanced_instruct_distill

    指令扩充 → 教师生成 → LLM 裁判评估 → 质量过滤 → SFT 构建,低分样本被过滤。

  • balanced_instruct_distill

    针对 LLM 合成指令常见的类别漂移问题,在生成前按任务类别自动分类与重采样,把类别分布控制在目标区间内。

  • augmented_instruct_distill

    对已有种子做 LLM 精炼,为每条指令生成多条候选回复,评估后择优入库。

思维链蒸馏:RV/CD 双指标课程混合

思维链数据并非越长越好。对小模型而言,远超其能力范围的冗长推理链更接近噪声。advanced_cot_distill 流水线在生成 CoT 轨迹后,用 LLM 裁判标注两个指标:推理冗余度(RV)度量推理链的详略程度,认知难度(CD)度量理解该推理所需的能力水平。随后 cot_mix_by_rv_cd 按 CD 分箱做课程混合,rv_target: matched 使简单问题配简洁推理、困难问题配详细推理,让学生模型获得与其能力区间适配的训练信号。配套 cot_long2short / cot_short2long 改写算子可对推理链做定向压缩或扩展。基于这套方法训练的 DistilQwen-ThoughtY-32B 在 AIME2024 上取得 90.0 分。

多模态蒸馏:视觉语言数据生产

mm_instruct_distill 为 (图像, 指令) 样本对生成教师回复,mm_cot_distill 进一步生成视觉思维链。两者均输出可直接用于视觉语言模型训练的多模态 SFT 数据:图像以 image_url 内容项嵌入 messages,支持本地路径、HTTP URL 与 base64 三种形态。进阶流水线 advanced_mm_distill 与 advanced_mm_cot_distill 在此基础上增加裁判评估与质量过滤。

Agent 蒸馏:从 persona 种子到多轮工具调用轨迹

训练工具调用模型的最大障碍是数据:真实 Agent 轨迹散落在业务系统中,获取困难、标注成本高。agent_distill 流水线采取完全合成路线,起点只需一行 persona 描述:

{"id": "persona_001", "background": "An Afrikaans music fan who wants to organize local events."}

从这一行种子开始,六个阶段依次执行:

  1. agent_task_synthesis

    从 persona 合成任务设定、可用工具集、预期工作流与约束条件。

  2. agent_fuzzy_task

    把结构化任务改写为信息不完整的模糊用户请求,让学生模型学会在多轮交互中主动追问。

  3. agent_tool_check

    对照模糊任务校验并修正工具定义。

  4. agent_trajectory

    以 LangGraph ReAct 循环展开多轮轨迹,SolveAgent、MockTool、MockUser 三个角色协同工作,max_steps 与 max_tool_calls 双重限额控制成本。

  5. agent_rubrics

    LLM 裁判针对当前任务动态生成评分准则,横向比较多条轨迹并选出最优解。

  6. 末段二选一

    build_sft 导出多轮 messages SFT 数据,或 build_preference_dataset 配成 chosen/rejected 偏好对供 DPO 训练。

这条流水线与 AgenticQwen 系列模型的数据生产流程同源:开源数据集 AgenticQwen-Data(80K 条)采用的正是相同的任务结构与 rubric 质量标注。

AIGC 文生图/视频蒸馏:从简短 prompt 到多模态训练对

文生图与文生视频场景存在共同的输入落差:用户输入“一只在月球上喝咖啡的猫”这类简短描述,而扩散模型发挥最佳效果需要包含主体、材质、光影、构图、风格的稠密 prompt。EasyDistill 2 把这类输入批量转化为 (优化后 prompt, 生成图片/视频) 多模态训练样本。

文生图蒸馏

advanced_t2i_distill 流水线包含四个阶段:

  1. prompt_optimize

    LLM/VLM 将简短 prompt 扩写为生产级描述。

  2. t2i_generate

    调用 Wanx、Qwen-Image 或 PAI-Diffusion 后端生成图片,T2IBackend 统一处理各家 API 协议差异。

  3. t2i_eval

    VLM-as-judge 从图文一致性、美学质量、细节丰富度、无伪影四个维度打分。

  4. quality_filter + build_t2i_sft``按分数阈值或 top-k 过滤后输出图像内嵌的多模态 SFT 数据。

文生视频蒸馏

advanced_t2v_distill 流水线(支持纯 T2V 与带首帧的 I2V 两种模式)遵循相同的“优化 → 生成 → 评估 → 建库”结构:

  1. prompt_optimize

    将简短 prompt 扩写为包含镜头运动、时间节奏、主体动作与场景变化的视频级描述;I2V 模式下额外对首帧图像做内容理解,保证后续视频与首帧语义一致。

  2. t2v_generate

    调用 Wanx 视频生成或 PAI-Diffusion 视频后端生成视频,T2VBackend 统一处理 EAS/PAI-Token 调用协议差异。

  3. t2v_eval

    先通过 VBench 快速检查明显短板(如画面静止、穿模),再按固定帧率抽帧由 VLM-as-judge 评估,可选地通过 Omni 类视频理解模型做整体一致性检测。

  4. quality_filter + build_t2v_sft``按分数阈值或 top-k 过滤后输出视频内嵌的多模态 SFT 数据。

把 VLM/VBench 作为质检环节纳入流水线,意味着每张图片、每段视频都经过评估并保留分数记录,质量标准可通过配置精确调节。

PE 改写蒸馏:把多轮 Prompt 增强能力蒸馏为一步改写

文生图/视频业务的线上链路中通常有一个 prompt 改写环节。多步 Agent 方案质量最好:先规划、再改写、最后反思,但三次串行 LLM 调用的延迟难以满足线上要求。pe_rewrite_distill 的思路是:离线阶段让教师 Agent 完整执行三步链,把最终结果蒸馏为学生模型的单次调用能力,同时获得多步方案的质量与单步调用的延迟。

关键设计包括:

  • 场景路由

    自动路由到 10 个场景之一,每个 (场景, 中/英) 组合有独立改写提示词文件。

  • 公共“铁律”机制

    忠实性、信息密度、画面文字扩写、引号锁定、语言规则、自检、输出格式等跨场景硬约束统一维护。

  • 九维合并裁判

    每条 (原始, 改写) 样本对只需一次裁判调用即完成全部九项评估,默认过滤门槛已内置。

  • 按场景保护的二次筛选

    keep_top_k / keep_top_ratio 按七项均分排名做二次精选,默认逐场景执行且每个场景至少保留一条。

  • 种子扩增

    可选的 seed_anchored_expansion 从少量种子 prompt 扩写出同场景大批新 prompt,扩增血缘完整记录。

开源模型与数据集

伴随 EasyDistill 系列框架,PAI 团队已在 HuggingFace(alibaba-pai)与 ModelScope(PAI)开源了完整的模型与数据集矩阵。

alibaba-pai: huggingface.co/alibaba-pai
PAI: modelscope.cn/organizatio…

模型家族

AgenticQwen定位规模HuggingFaceModelScope
AgenticQwenAgent 工具调用(多轮 RL 训练)8B、30B-A3B(MoE)Collection主页
DistilQwen2 / DistilQwen2.5指令遵循0.5B–7B
DistilQwen2.5-R1DeepSeek-R1 蒸馏推理7B、14B、32B
DistilQwen2.5-DS3-0324DeepSeek-V3-0324 蒸馏快思考3B–32B
DistilQwen-ThoughtXOmniThought RV/CD 课程混合7B、32B
DistilQwen-ThoughtYQwen3 底座自适应思考4B、8B、32B
Collection: huggingface.co/collections…
主页: modelscope.cn/organizatio…

代表性结果

  • DistilQwen-ThoughtY-32B [1](ModelScope [2])在 AIME2024 上取得 90.0 分、MATH500 上取得 95.2 分;同尺寸 DeepSeek-R1-Distill-Qwen-32B 在 AIME2024 上为 74.7 分,RV/CD 课程混合的数据方法论在同等参数量下带来了 15 分以上的差距(看这里 [3])。

  • DistilQwen2.5-7B-Instruct [4](ModelScope [5])在 AlpacaEval 2.0 (LC) 上取得 34.86 分,超过 Qwen2.5-7B-Instruct 的 31.43 分,蒸馏后的学生模型超过了同尺寸官方指令模型(看这里 [6])。

  • AgenticQwen-30B-A3B [7](ModelScope [8])每次前向仅激活 3B 参数,在 BFCL-V4、TAU-2 等 Agent 基准上追平或超越 8B 稠密模型,工具调用能力与推理成本得以兼顾(看这里 [9])。

[1] huggingface.co/alibaba-pai…
[2] modelscope.cn/models/PAI/…
[3] developer.aliyun.com/article/166…
[4] huggingface.co/alibaba-pai…
[5] modelscope.cn/models/PAI/…
[6] developer.aliyun.com/article/165…
[7] huggingface.co/alibaba-pai…
[8] modelscope.cn/models/PAI/…
[9] zhuanlan.zhihu.com/p/202707124…

数据集

数据集规模类型HuggingFaceModelScope
AgenticQwen-Data80KAgent 任务与多轮轨迹(含 rubric 标注)HF [1]MS[2]
DistilQwen_100K100K指令遵循HF [3]MS [4]
DistilQwen_1M1M指令遵循HF [5]MS [6]
OmniThought2MCoT 推理(带 RV/CD 标注)HF [7]MS [8]
OmniThought-0528365KCoT 推理(DeepSeek-R1-0528 教师)HF [9]MS [10]

OmniThought 的 200 万条推理轨迹每条都带有 RV/CD 双标注,可直接用于复现课程混合训练,无需自行打标。

[1] huggingface.co/datasets/al…
[2] modelscope.cn/datasets/PA…
[3] huggingface.co/datasets/al…
[4] modelscope.cn/datasets/PA…
[5] huggingface.co/datasets/al…
[6] modelscope.cn/datasets/PA…
[7] huggingface.co/datasets/al…
[8] modelscope.cn/datasets/PA…
[9] huggingface.co/datasets/al…
[10] modelscope.cn/datasets/PA…

PAI 平台端到端实践:从种子指令到学生模型部署

上述框架能力在阿里云 PAI 平台上可以零额外开发地落地。以下以“指令蒸馏 + 学生模型 SFT 训练”为例,演示从环境准备到模型部署的完整路径。数据生产全程只需 CPU 实例,所有模型推理通过 PAI-Token API 完成,GPU 资源仅用于最后的训练步骤。

第一步:创建 DSW 实例并配置环境

1.1 创建 DSW CPU 实例

登录 PAI 控制台,选择目标地域与工作空间,进入 模型开发与训练 > 交互式建模(DSW),单击 新建实例。关键配置如下:

PAI 控制台: pai.console.aliyun.com/
参数推荐配置说明
实例名称easydistill-data自定义名称,便于识别
资源类型公共资源(按量付费)无需预购配额
资源规格CPU 实例,如 ecs.g6.xlarge(4 vCPU / 16 GiB)数据生产只需 CPU
镜像配置官方镜像,搜索 modelscope 选择最新版本兼容性好,预装常用库
存储挂载挂载 OSS(推荐)或 NAS持久化存储训练数据与产出

实例状态变为 运行中 即创建成功。

1.2 开通 PAI-Token 服务

PAI-Token 暴露 OpenAI 兼容的 Chat Completions 接口,覆盖 Qwen、DeepSeek、Kimi、GLM 等主流模型系列。在 PAI 控制台选择 快速开始 > Token 服务,单击 一键开通;开通后查看或创建 API Key。若 DSW 实例已配置 PAI 默认角色(RAM 角色),系统会自动获取 Token。

1.3 安装 EasyDistill2.0

进入 DSW 开发环境的 Terminal,执行:

cd /mnt/data
git clone https://github.com/modelscope/easydistill.git
cd easydistill
pip install -e .

若 DSW 未配置默认角色,需手动设置:

export PAI_TOKEN_API_KEY=your_pai_token_key
export PAI_TOKEN_BASE_URL=https://cn-beijing.pai-token.aliyuncs.com/v1

CLI 启动时会先对后端做健康检查,避免长任务中途失败造成 API 费用浪费。

第二步:准备种子指令

EasyDistill2.0 接受 JSONL 格式种子文件,每行一条 JSON 对象,最少只需 instruction 字段:

{"id": "1", "instruction": "解释什么是知识蒸馏,用一段话说明。"}
{"id": "2", "instruction": "写一个 Python 函数,不使用切片操作反转字符串。"}
{"id": "3", "instruction": "监督微调和人类反馈强化学习的主要区别是什么?"}

保存为 /mnt/data/easydistill/examples/seed_my_task.jsonl。50–200 条覆盖典型任务类型与不同难度层次的种子是合理起步规模;种子质量优先于数量,因为扩展阶段会放大分布偏斜。

第三步:运行蒸馏流水线

3.1 配置文件

创建 /mnt/data/easydistill/configs/my_advanced_instruct.yaml:

job_type: advanced_instruct_distill

backend:
  type: pai_token
  api_key: ${PAI_TOKEN_API_KEY}
  base_url: ${PAI_TOKEN_BASE_URL}
  model_id: qwen3.6-plus          # 教师模型,更换只需改这一行

generation:
  system_prompt: "You are a helpful assistant. Provide concise and accurate answers."
  temperature: 0.7
  max_tokens: 2048

eval:
  metrics: [informativeness, helpfulness, generalization, correctness]
  temperature: 0.0
  max_workers: 4

pipeline:
  - stage: instruction_expansion
    config: {num_output_samples: 3, max_workers: 3}
    output_path: outputs/my_stage1_expanded.jsonl
  - stage: instruction_refinement
    config: {max_workers: 3}
    output_path: outputs/my_stage2_refined.jsonl
  - stage: generate
    config: {max_workers: 3}
    output_path: outputs/my_stage3_generated.jsonl
  - stage: instruct_eval
    config: {max_workers: 4}
    output_path: outputs/my_stage4_evaluated.jsonl
  - stage: quality_filter
    config:
      min_scores: {informativeness: 6, helpfulness: 6, generalization: 4, correctness: true}
      keep_top_ratio: 0.7
    output_path: outputs/my_stage5_filtered.jsonl
  - stage: build_sft
    config: {}

dataset:
  input_path: examples/seed_my_task.jsonl
  output_path: outputs/my_sft_dataset.jsonl
  skip_empty: true
  min_length: 10
  max_length: 8192

关键参数说明:

  • backend.model_id

    教师模型。qwen3.6-plus 在质量与成本间平衡;更强教师可换 qwen3.7-max,极低成本可换 qwen3.5-plus。

  • quality_filter.min_scores

    informativeness 和 helpfulness 不低于 6 分(满分 10),correctness 必须为 true。

  • quality_filter.keep_top_ratio

    通过门槛的样本中只保留排名前 70%,做二次精选。

  • max_workers

    并发 API 调用数。PAI-Token 有并发限制,起步建议 3–4,遇到 429 错误时调低。

3.2 执行蒸馏

cd /mnt/data/easydistill
easydistill --config configs/my_advanced_instruct.yaml

以 50 条种子为例,总 API 调用量约 500 次,约 15–30 分钟完成全部数据处理。

第四步:与 PAI-Model Gallery 模型库训练格式对齐

PAI-Model Gallery 模型库封装了 PAI-DLC(分布式训练)和 PAI-EAS(在线服务),底层使用 transformers 训练框架。

4.1 格式转换

EasyDistill2.0 内置工具函数,一行命令完成转换:

python convert_to_alpaca.py outputs/my_sft_dataset.jsonl outputs/my_sft_alpaca.json

转换后的 JSON 文件格式如下:

[
  {
    "instruction": "You are a helpful assistant.\n解释什么是知识蒸馏,用一段话说明。",
    "output": "知识蒸馏是一种模型压缩技术..."
  }
]

4.2 上传训练数据到 OSS

PAI 模型库训练数据需通过 OSS 上传。若未开通 OSS,访问 OSS 控制台 创建 Bucket(地域与 PAI 一致)。上传方式:

  • DSW 已挂载 OSS:直接复制到挂载路径。

  • 未挂载:通过 OSS 控制台手动上传,或使用 ossutil:

ossutil cp /mnt/data/easydistill/outputs/my_sft_alpaca.json oss://your-bucket/pai_data/
OSS 控制台: oss.console.aliyun.com/

第五步:在 PAI-Model Gallery 模型库发起学生模型训练

5.1 选择基础模型

登录 PAI 控制台,选择 快速开始 > Model Gallery,搜索并选择学生模型(如 Qwen3-0.6B、Qwen3-1.7B、Qwen3-4B 等)。

PAI 控制台: pai.console.aliyun.com/

5.2 配置训练任务

在模型详情页单击 训练,关键参数如下:

参数类型参数推荐值通过输入输出对微调模型参数
训练方式训练方式SFT 监督微调高效微调,节省显存;也支持全参/QLoRA
训练方式微调方法LoRA单击“选择 OSS 文件或目录”导航到文件
数据集训练数据集OSS 中的 my_sft_alpaca.jsonl训练过程中评估泛化能力
数据集验证数据集OSS 中的验证集(可选)存储模型与 TensorBoard 日志
输出模型输出路径oss://your-bucket/output/控制台已筛选满足显存要求的规格
资源资源类型公共资源(按量付费)LoRA 典型学习率
超参数learning_rate0.0005蒸馏数据通常 3–4 轮收敛
超参数num_train_epochs4单卡批次大小
超参数per_device_train_batch_size8含长回复时适当增大
超参数seq_length512 或 20487B 模型通常够用,复杂任务可增至 16–32
超参数lora_rank8(默认)通过输入输出对微调模型参数

配置完成后单击 训练 > 确定,任务变为 运行中 时开始微调。

5.3 查看训练过程

在训练任务详情页查看日志与指标曲线:

曲线趋势判断调整建议
train_loss 和 eval_loss 均在下降欠拟合增加 num_train_epochs 或提高 lora_rank
train_loss 下降但 eval_loss 上升过拟合减少 num_train_epochs 或降低 lora_rank
train_loss 和 eval_loss 均趋于平稳良好拟合可进入部署阶段

5.4 部署微调后的模型

  1. 在训练任务详情页单击 部署(按钮不可点击时等待约 1 分钟让模型完成注册)。

  2. 选择与模型参数量匹配的实例规格(0.6B 模型约需 5GB 显存)。

  3. 保持默认参数,单击 部署 > 确定。约 5 分钟后状态变为 运行中。

  4. 在服务详情页单击 查看调用信息,获取公网调用地址和 Token。

部署后支持 OpenAI 兼容接口调用:

from openai import OpenAI

client = OpenAI(
    api_key="your_eas_token",
    base_url="调用地址/v1",
)
resp = client.chat.completions.create(
    model="Qwen3-0.6B",
    messages=[{"role": "user", "content": "解释什么是知识蒸馏"}],
    max_tokens=512,
    temperature=0,
)
print(resp.choices[0].message.content)

结语

从 EasyDistill 到 EasyDistill2.0,变化的不只是功能数量。第一代回答“怎么蒸”,第二代回答“怎么规模化地把教师模型的能力转化为训练资产”:配置驱动的流水线让数据生产可复现,后端无关的模型接入让教师可替换,训练就绪的数据格式消除了接入训练框架的转换成本,六大蒸馏场景收敛到同一套工程范式之下。

在阿里云 PAI 平台上,这套范式的工程门槛被进一步降低到“一份 YAML 配置 + 一份种子文件”:DSW CPU 实例做编排、PAI-Token 做教师推理、PAI-Model Gallery 做学生训练和部署,从种子到可部署的学生模型形成完整闭环。其有效性已由开源成果验证:DistilQwen 与 AgenticQwen 两个模型家族、累计超过 350 万条的开源数据集,均产自同一套数据生产方法论。后续我们将围绕更多蒸馏场景与更强的教师模型持续迭代框架与模型家族,帮助更多开发者与企业低成本地构建属于自己的小模型。

参考工作

PAI 团队模型蒸馏相关论文:

  • Yuanjie Lyu, Chengyu Wang, Lei Shen, Jun Huang, Tong Xu. Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards. ACL 2026

  • Yuanjie Lyu, Chengyu Wang, Haonan Zheng, Yuanhao Yue, Junbing Yan, Ming Wang, Jun Huang. AgenticQwen: Training Small Agentic Language Models with Dual Data Flywheels for Industrial-Scale Tool Use. ACL 2026

  • Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang. Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations. ACL 2026

  • Lei Shen, Chengyu Wang, Yuanjie Lyu, Yuanhao Yue, Jun Huang, Zhongmin Cai. Self-Evolutionary Reinforced Knowledge Distillation for Multi-Modal Tool-Use Agents. KDD 2026

  • Yuanjie Lyu, Chengyu Wang, Jun Huang, Tong Xu. Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs. ICML 2026

  • Chengyu Wang, Junbing Yan, Wenrui Cai, Yuanhao Yue, Jun Huang. EasyDistill: A Comprehensive Toolkit for Effective Knowledge Distillation of Large Language Models. EMNLP 2025

  • Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang. Thinking with DistilQwen: A Tale of Four Distilled Reasoning and Reward Model Series. EMNLP 2025

  • Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang. Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment. EMNLP 2025

  • Chengyu Wang, Junbing Yan, Yuanhao Yue, Jun Huang. DistilQwen2.5: Industrial Practices of Training Distilled Open Lightweight Language Models. ACL 2025

  • Yuanhao Yue, Chengyu Wang, Jun Huang, Peng Wang. Building a Family of Data Augmentation Models for Low-cost LLM Fine-tuning on the Cloud. COLING 2025

  • Yuanhao Yue, Chengyu Wang, Jun Huang, Peng Wang. Distilling Instruction-following Abilities of Large Language Models with Task-aware Curriculum Planning. EMNLP