开源模型

Inkling 1.0

Inkling系列 · Thinking Machines Lab · 2026-07发布

开源支持本地部署多模态长上下文

模型介绍

Thinking Machines Lab 开源的千亿级多模态模型,975B 总参 / 41B 激活 MoE、66 层、256 专家,支持文本/图像/音频输入,原生 1M 上下文,Apache-2.0 开放权重。

模型基础信息

模型系列Inkling系列
开发机构Thinking Machines Lab
发布时间2026-07
参数规模975B(MoE,激活 41B)
上下文窗口1M
模型类型多模态(文本+图像+音频)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源权重免费

免费规则详情

权重 Apache-2.0 免费开源,自行部署。

收费标准简介

开源免费;算力自备。

模型能力介绍

✅ 核心优势

  • 千亿级多模态能力
  • 原生 1M 上下文
  • pache-2.0 开放权重
  • 稀疏 MoE,激活效率高

⚠️ 短板与局限

  • 部署门槛高
  • 国内直连受限
  • 生态较新

🎯 适用场景

  • 多模态研究
  • 超长上下文分析
  • 私有化多模态服务
  • 前沿模型实验

模型使用教程

本章节整理 Inkling 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:<https://huggingface.co/thinkingmachines/Inkling>(Hugging Face 在线试玩)或 Thinking Machines Lab 官方平台。
  • 能力简介:Thinking Machines Lab 开源千亿级多模态模型,975B 总参 / 41B 激活,支持文本/图像/音频输入,原生 1M 上下文。
  • 适用场景:多模态研究、超长上下文分析、私有化多模态服务、前沿模型实验。
  • 使用建议:部署门槛高,建议先使用托管平台或量化版本。
  • 开发接入:权重开源,参考 GitHub 部署。
  1. 访问 [Hugging Face](https://huggingface.co/thinkingmachines/Inkling) 下载权重。
  2. 克隆仓库:
git lfs install
git clone https://huggingface.co/thinkingmachines/Inkling
  1. 环境要求:多卡高端 GPU,PyTorch + vLLM / SGLang。

启动服务

vllm serve thinkingmachines/Inkling --served-model-name inkling

curl 调用

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"inkling","messages":[{"role":"user","content":"你好,请自我介绍"}]}'

Python 调用

from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
    model="inkling",
    messages=[{"role": "user", "content": "你好,请自我介绍"}],
)
print(resp.choices[0].message.content)

> 提示:支持文本/图像/音频多模态输入。

  • 部署方式:开放权重(Apache-2.0),支持 vLLM / SGLang。
  • 硬件要求:975B 总参 / 41B 激活,建议多卡 H100 / A100 集群。
  • 参考:Thinking Machines Lab GitHub 与模型卡提供部署说明。

💡 使用小技巧

文本/图像/音频均可输入,适合统一多模态底座。

❓ 常见问题 FAQ

Q1:支持哪些模态?

A1:文本、图像、音频输入,文本输出。

访问备注与注意事项