开源模型

Ling 3.0 Flash 3.0 Flash

Ling 3.0 Flash系列 · 无问芯穹(InclusionAI) · 2026-08发布

开源支持本地部署国内可直连长上下文代码专用

模型介绍

无问芯穹开源的混合线性 MoE 模型,124B 总参 / 5.5B 激活,KDA + MLA 混合架构、512 路由专家,训练上下文从 8K 提升至 256K,fp8 权重开放。

模型基础信息

模型系列Ling 3.0 Flash系列
开发机构无问芯穹(InclusionAI)
发布时间2026-08
参数规模124B(MoE,激活 5.5B)
上下文窗口256K
模型类型文本(推理)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源权重免费

免费规则详情

fp8 权重在 Hugging Face 免费开放,自行部署。

收费标准简介

开源免费;算力自备。

模型能力介绍

✅ 核心优势

  • 5.5B 激活,极高性价比
  • 混合线性架构创新
  • 256K 上下文
  • fp8 权重开箱可用

⚠️ 短板与局限

  • 生态较新
  • 总参数较大需多卡
  • 推理框架适配需跟进

🎯 适用场景

  • 高效推理服务
  • gent 开发
  • 本地私有化部署
  • 前沿架构研究

模型使用教程

本章节整理 Ling 3.0 Flash 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:<https://huggingface.co/inclusionAI/Ling-3.0-flash-fp8>(Hugging Face 试玩)或无问芯穹开放平台。
  • 能力简介:无问芯穹开源混合线性 MoE 模型,124B 总参 / 5.5B 激活,KDA+MLA 混合架构,256K 上下文。
  • 适用场景:高效推理服务、Agent 开发、本地私有化部署、前沿架构研究。
  • 使用建议:优先使用 fp8 权重,注意 SGLang / vLLM 支持进度。
  • 开发接入:权重开源,参考 GitHub 部署。
  1. 访问 [Hugging Face](https://huggingface.co/inclusionAI/Ling-3.0-flash-fp8) 下载 fp8 权重。
  2. 克隆仓库:
git lfs install
git clone https://huggingface.co/inclusionAI/Ling-3.0-flash-fp8
  1. 环境要求:PyTorch + vLLM / SGLang,多卡 GPU。

启动服务

vllm serve inclusionAI/Ling-3.0-flash-fp8 --served-model-name ling-3.0-flash

curl 调用

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"ling-3.0-flash","messages":[{"role":"user","content":"你好,请自我介绍"}]}'

Python 调用

from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
    model="ling-3.0-flash",
    messages=[{"role": "user", "content": "你好,请自我介绍"}],
)
print(resp.choices[0].message.content)

> 提示:混合线性架构推理更快,激活参数仅 5.5B。

  • 部署方式:开源权重(fp8),支持 vLLM / SGLang。
  • 硬件要求:124B 总参 / 5.5B 激活,量化后多卡消费级 / 专业卡可运行。
  • 参考:无问芯穹 GitHub 提供部署脚本。

💡 使用小技巧

优先使用 fp8 权重,注意 SGLang / vLLM 支持进度。

❓ 常见问题 FAQ

Q1:和 Ling-3.0-Tiny 区别?

A1:Flash 为旗舰高效版,Tiny 更小。

访问备注与注意事项