分布式开源本地部署集群 本地部署模型

Exo(分布式推理) v0.18

Exo系列 · Exo Labs(开源社区) · 2024-07发布

开源支持本地部署国内可直连有免费额度

模型介绍

把家里多台闲置设备(笔记本/树莓派)组成分布式推理集群来跑大模型,无需高端显卡即可本地部署 70B+ 模型,创新玩法备受关注。

模型基础信息

模型系列Exo系列
开发机构Exo Labs(开源社区)
发布时间2024-07
参数规模框架(无固定参数)
上下文窗口分布式大模型推理
模型类型分布式推理框架
中文能力待评估
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

完全免费开源

免费规则详情

开源免费。

收费标准简介

完全免费;复用闲置设备。

模型能力介绍

✅ 核心优势

  • 多设备协作跑大模型
  • 无需高端显卡
  • 安装简单
  • 支持主流开源模型

⚠️ 短板与局限

  • 分布式推理速度一般
  • 网络稳定性影响
  • 适合实验与轻度使用

🎯 适用场景

  • 闲置设备再利用
  • 本地大模型体验
  • 分布式推理实验
  • 隐私敏感场景

模型使用教程

本章节整理 Exo(分布式推理) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 每台设备安装 exo 并启动,自动发现组成集群。
  • 界面(默认 GUI)选择模型温度与并发。
  • 亦可命令行 exo run 或 curl 调用 OpenAI 兼容接口。
pip install exo

启动后提供 OpenAI 兼容 API(默认 localhost:8000),可对接 ChatGPT-Next-Web 等:

curl http://localhost:8000/v1/chat/completions -d '{"model":"llama-3.3-70b","messages":[{"role":"user","content":"你好"}]}'
pip install exo
exo

启动后其他设备也运行 exo,同一网络自动组网;在界面选择模型(如 Llama-3.3-70B)即可。

💡 使用小技巧

多台设备同一局域网即可组网。

exo run 一键启动。

❓ 常见问题 FAQ

Q1:Exo 能跑多大模型?

A1:多设备聚合后可跑 70B+(视设备总内存)。

Q2:要特殊硬件吗?

A2:不需要 GPU,普通设备即可。

访问备注与注意事项