开源模型
Inkling 1.0
Inkling系列 · Thinking Machines Lab · 2026-07发布
模型介绍
Thinking Machines Lab 开源的千亿级多模态模型,975B 总参 / 41B 激活 MoE、66 层、256 专家,支持文本/图像/音频输入,原生 1M 上下文,Apache-2.0 开放权重。
模型基础信息
模型系列Inkling系列
开发机构Thinking Machines Lab
发布时间2026-07
参数规模975B(MoE,激活 41B)
上下文窗口1M
模型类型多模态(文本+图像+音频)
中文能力良好
使用方式网页体验 / API调用 / 本地部署
免费额度与收费政策
开源权重免费
免费规则详情
权重 Apache-2.0 免费开源,自行部署。
收费标准简介
开源免费;算力自备。
模型能力介绍
✅ 核心优势
- 千亿级多模态能力
- 原生 1M 上下文
- pache-2.0 开放权重
- 稀疏 MoE,激活效率高
⚠️ 短板与局限
- 部署门槛高
- 国内直连受限
- 生态较新
🎯 适用场景
- 多模态研究
- 超长上下文分析
- 私有化多模态服务
- 前沿模型实验
模型使用教程
本章节整理 Inkling 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 体验网址:<https://huggingface.co/thinkingmachines/Inkling>(Hugging Face 在线试玩)或 Thinking Machines Lab 官方平台。
- 能力简介:Thinking Machines Lab 开源千亿级多模态模型,975B 总参 / 41B 激活,支持文本/图像/音频输入,原生 1M 上下文。
- 适用场景:多模态研究、超长上下文分析、私有化多模态服务、前沿模型实验。
- 使用建议:部署门槛高,建议先使用托管平台或量化版本。
- 开发接入:权重开源,参考 GitHub 部署。
- 访问 [Hugging Face](https://huggingface.co/thinkingmachines/Inkling) 下载权重。
- 克隆仓库:
git lfs install
git clone https://huggingface.co/thinkingmachines/Inkling
- 环境要求:多卡高端 GPU,PyTorch + vLLM / SGLang。
启动服务
vllm serve thinkingmachines/Inkling --served-model-name inkling
curl 调用
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"inkling","messages":[{"role":"user","content":"你好,请自我介绍"}]}'
Python 调用
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="inkling",
messages=[{"role": "user", "content": "你好,请自我介绍"}],
)
print(resp.choices[0].message.content)
> 提示:支持文本/图像/音频多模态输入。
- 部署方式:开放权重(Apache-2.0),支持 vLLM / SGLang。
- 硬件要求:975B 总参 / 41B 激活,建议多卡 H100 / A100 集群。
- 参考:Thinking Machines Lab GitHub 与模型卡提供部署说明。
💡 使用小技巧
文本/图像/音频均可输入,适合统一多模态底座。
❓ 常见问题 FAQ
Q1:支持哪些模态?
A1:文本、图像、音频输入,文本输出。
访问备注与注意事项
- 2026-07-15 发布,权重在 Hugging Face 开放
Aitishiku.com