exo 完整指南:3条命令拼出4节点AI集群,本地跑起235B分布式推理

📅 发布时间:2026/8/31 12:43:00
exo 完整指南:3条命令拼出4节点AI集群,本地跑起235B分布式推理
exo 完整指南3条命令拼出4节点AI集群本地跑起235B分布式推理【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 把多台 Mac 拼成一台 AI 集群用分布式推理在本地跑下 235B 级别的大模型。4 节点配 RDMA 时Qwen3-235B 实测 31.9 tokens/s是同配置走 TCP 的两倍以上。单卡喂不动 200B 参数的日子想在本地跑 235B 的模型你会先撞上内存墙单台 Mac 的内存还没开始推理就填满了。买高端显卡不现实租云上实例又意味着把数据交出去。exo 走的是第三条路——把家里已有的 Mac 接成一个集群模型分片切开、摊到每台机器上做分布式推理。设备在同一局域网里自动互相发现不用手写任何配置而且机器越多加得越多速度还会涨。3条命令启动第一个节点先装好 uv一个很快的 Python 包管理器然后git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo uv sync再构建一次仪表盘并启动端口 52415 上同时提供网页管理和 APIcd dashboard npm install npm run build cd .. uv run exo嫌源码麻烦的话macOS 上直接brew install --cask exo就能装个常驻后台的官方应用。每个节点都这样跑起来之后真正的问题是它们凭什么知道该怎么分工。集群里的派单系统怎么运转 一个 exo 节点内部装着 5 个角色结构很像外卖平台Master调度中心实时盯着整个集群的状态决定模型的哪一片放到哪台机器上。Worker站点管理员管本机的下载、系统信息采集和任务执行把情况上报。Runner骑手真正的推理跑在独立进程里崩了只影响自己不拖垮整机。API接单窗口对外暴露 OpenAI 兼容的接口客户端从这里下单。Election选举调度中心掉线时各节点投票选出新负责人网络再抖也能收敛出一个主。组件之间靠事件溯源通信——每次操作都记成一条带序号的流水账状态随时可以按顺序回放重建。所以个别节点掉线集群状态不会乱。想深入可以看 src/exo/master/ 里的放置算法和事件排序代码。实测对比RDMA 比 TCP 快一倍 ⚙️多机推理最大的开销在机器间传数据。exo 首发支持 Thunderbolt 5 上的 RDMA——RDMA 让一台机器直接读写另一台的内存绕过内核延迟大幅下降。4 台 M3 Ultra Mac Studio、Qwen3-235B8-bit的实测结果RDMA 通信31.9 tokens/s传统 TCP15.2 tokens/s硬件、模型、切法完全一样只是通信路径不同出字速度就翻了一倍多。再叠加张量并行——把每层权重矩阵切成分片、多台机器同时算——2 台设备加速 1.8 倍4 台加速 3.2 倍。加机器变快不是口号是有数字的。要吃到 RDMA 红利硬件得带 TB5M3 Ultra、M4 Pro、M4 Max系统要到 macOS 26.2具体注意哪些坑放在下一章。进阶玩法拓扑、API 与多模型 跑通之后你多半想看清集群内部在忙什么并把自己的工具接进来。拓扑图告诉你模型片在哪仪表盘上的实时拓扑图里节点是机器连线是链路能看到带宽和延迟。Master 做拓扑感知自动分片就是基于这张图挑最优切法——设备一多这种活没法靠人脑。API 四步完成一次推理# 1. 预览可行的分片方案 curl http://localhost:52415/instance/previews?model_idllama-3.2-1b # 2. 创建实例 curl -X POST http://localhost:52415/instance -H Content-Type: application/json -d {instance: {...}}创建是异步命令不能立刻发请求。先curl -N http://localhost:52415/instance/await?model_id...等type: ready再按 OpenAI 格式打/v1/chat/completions。完整端点清单在 docs/api.md。现有工具直接接模型可扩展exo 同时兼容 OpenAI Chat Completions、Claude Messages、OpenAI Responses、Ollama 四种格式客户端只改 base URL 就能指向你的集群OpenWebUI 这类前端也能直接用。模型侧可以用POST /models/add拉取 HuggingFace 上的任意模型官方基准覆盖 Qwen3-235B8-bit、DeepSeek v3.1 671B8-bit、Kimi K2 Thinking4-bit全部在 4 台 M3 Ultra Mac Studio 上测得。三条坑位提醒 ⚠️1. 同网络的两台 Mac 互相看不见现象启动后仪表盘只有一个节点。原因发现机制走局域网RDMA 链路还要求每台机器 macOS 版本完全一致连 beta 编号都不能差。对策先确认同网段再做 RDMA 前把所有系统版本对齐。2. RDMA 没生效速度停在 15 tokens/s 左右现象吞吐只有 TCP 水平。原因TB5 硬件、TB5 线缆、全互连线缆每台都要物理连到每台、macOS 26.2 四项缺一不可Mac Studio 还要避开紧邻网口的 TB5 端口。对策恢复模式里执行rdma_ctl enable然后在拓扑图里确认链路已走 RDMA。3. 实例没就绪就发了推理请求现象POST /instance后立即调 chat 报模型不存在。原因创建是异步命令模型还在加载。对策一律先等/instance/await返回 ready 再发请求。如果你手上有几台 Mac、想本地跑 235B 级模型又不想碰云exo 是目前把分布式推理门槛压到最低的开源自选项之一——剩下的就是接线和等下载了。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考