开源模型
Ling 3.0 Flash 3.0 Flash
Ling 3.0 Flash系列 · 无问芯穹(InclusionAI) · 2026-08发布
模型介绍
无问芯穹开源的混合线性 MoE 模型,124B 总参 / 5.5B 激活,KDA + MLA 混合架构、512 路由专家,训练上下文从 8K 提升至 256K,fp8 权重开放。
模型基础信息
模型系列Ling 3.0 Flash系列
开发机构无问芯穹(InclusionAI)
发布时间2026-08
参数规模124B(MoE,激活 5.5B)
上下文窗口256K
模型类型文本(推理)
中文能力良好
使用方式网页体验 / API调用 / 本地部署
免费额度与收费政策
开源权重免费
免费规则详情
fp8 权重在 Hugging Face 免费开放,自行部署。
收费标准简介
开源免费;算力自备。
模型能力介绍
✅ 核心优势
- 5.5B 激活,极高性价比
- 混合线性架构创新
- 256K 上下文
- fp8 权重开箱可用
⚠️ 短板与局限
- 生态较新
- 总参数较大需多卡
- 推理框架适配需跟进
🎯 适用场景
- 高效推理服务
- gent 开发
- 本地私有化部署
- 前沿架构研究
模型使用教程
本章节整理 Ling 3.0 Flash 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 体验网址:<https://huggingface.co/inclusionAI/Ling-3.0-flash-fp8>(Hugging Face 试玩)或无问芯穹开放平台。
- 能力简介:无问芯穹开源混合线性 MoE 模型,124B 总参 / 5.5B 激活,KDA+MLA 混合架构,256K 上下文。
- 适用场景:高效推理服务、Agent 开发、本地私有化部署、前沿架构研究。
- 使用建议:优先使用 fp8 权重,注意 SGLang / vLLM 支持进度。
- 开发接入:权重开源,参考 GitHub 部署。
- 访问 [Hugging Face](https://huggingface.co/inclusionAI/Ling-3.0-flash-fp8) 下载 fp8 权重。
- 克隆仓库:
git lfs install
git clone https://huggingface.co/inclusionAI/Ling-3.0-flash-fp8
- 环境要求:PyTorch + vLLM / SGLang,多卡 GPU。
启动服务
vllm serve inclusionAI/Ling-3.0-flash-fp8 --served-model-name ling-3.0-flash
curl 调用
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"ling-3.0-flash","messages":[{"role":"user","content":"你好,请自我介绍"}]}'
Python 调用
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="ling-3.0-flash",
messages=[{"role": "user", "content": "你好,请自我介绍"}],
)
print(resp.choices[0].message.content)
> 提示:混合线性架构推理更快,激活参数仅 5.5B。
- 部署方式:开源权重(fp8),支持 vLLM / SGLang。
- 硬件要求:124B 总参 / 5.5B 激活,量化后多卡消费级 / 专业卡可运行。
- 参考:无问芯穹 GitHub 提供部署脚本。
💡 使用小技巧
优先使用 fp8 权重,注意 SGLang / vLLM 支持进度。
❓ 常见问题 FAQ
Q1:和 Ling-3.0-Tiny 区别?
A1:Flash 为旗舰高效版,Tiny 更小。
访问备注与注意事项
- Ling 3.0 系列 2026 年陆续开源
Aitishiku.com