发布时间:2026/8/31 9:13:05
多台 Mac 组建成一个分布式 AI 集群:exo 多机推理加速完整指南 多台 Mac 组建成一个分布式 AI 集群exo 多机推理加速完整指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo想让大模型跑起来又不想为单台机器更高的内存买单exo 把这条路的成本拉低了很多。它开源的分布式 AI 集群框架让运行 exo 的设备在局域网内自动发现彼此、自动组网多台设备共享一个模型借助 Thunderbolt 5 上的 RDMA 通信设备间延迟降低 99%张量并行下 2 台设备最高提速 1.8 倍、4 台设备最高 3.2 倍。这篇指南带你从零把集群搭起来并讲清 RDMA 开启和日常跑模型的要点。上图为 4 台 M3 Ultra Mac Studio 上 Qwen3-235B8-bit的实测对比exoRDMA对 llama.cppTCP节点越多差距越大4 节点时 exo 达到 31.9 tokens/s。动手前的准备环境要求与三条安装命令系统方面需要 macOS Tahoe 26.2 或 LinuxLinux 目前跑在 CPU 上GPU 支持仍在开发。macOS 上另需准备 Xcode提供 MLX 编译所需的 Metal 工具链、uvPython 依赖管理、node构建仪表盘和 Rust 工具链。如果这些依赖已就绪实际只需要三条命令git clone https://gitcode.com/GitHub_Trending/exo8/exocd exo/dashboard npm install npm run build cd ..uv run exo启动后每台设备的http://localhost:52415都会提供仪表盘和 API这是后续所有操作的基础。3 步拉起第一个 exo 集群第一台机器执行uv run exo它就是集群的第一个节点。同一网络里的其他设备同样安装并运行 exo无需任何手动配置它们会自动发现并加入集群。打开任一节点的仪表盘确认所有节点都已出现在列表中。图中 4 台 Mac Studio 组成一个 exo 集群每个节点标注了内存、温度和功耗虚线表示节点间的通信链路。这里要提一句框架内部exo 会基于实时的拓扑视图——包括每台设备的资源和每条链路间的延迟、带宽——自动决定模型怎么拆分到各台设备上也就是所谓的拓扑感知自动并行你不需要手工规划。RDMA 开启的 6 个步骤与 3 个坑 ⚡RDMARemote Direct Memory Access绕过 CPU 直接读写远端内存的通信技术是 macOS 26.2 引入的能力适用于带 Thunderbolt 5 的机型M4 Pro Mac Mini、M4 Max MacBook Pro、M4 Max 和 M3 Ultra Mac Studio 等。每台参与 RDMA 的 Mac 都要执行一次以下操作关机长按电源键 10 秒直到出现启动菜单选择选项进入恢复模式从实用工具菜单打开终端执行下面这条命令并回车重启 Mac。rdma_ctl enable之后 exo 会自动接管 RDMA 链路。但有三个坑必须避开集群内每台设备必须直连其余所有设备全互联不要依赖交换机中转线缆必须是支持 TB5 的Mac Studio 上以太网口旁边的那个 TB5 口不能用所有设备的 macOS 版本必须完全一致连 beta 版本号都要一样否则 RDMA 端口可能互相发现不了。日常使用仪表盘为主API 为辅打开浏览器访问http://localhost:52415在右侧 INSTANCE 面板点击 LAUNCH INSTANCE选模型、选分片策略Pipeline 或 Tensor、选通信方式MLX Ring 或 MLX RDMA、设最小节点数即可启动。中间拓扑视图会实时刷新各节点状态。仪表盘展示的是 4 台 512GB M3 Ultra Mac Studio 集群同时承载 DeepSeek v3.18-bit与 Kimi-K2-Thinking4-bit聊天、拓扑、实例管理三合一。习惯命令行的话管理动作同样可以走 API。最典型的用法是发一条 OpenAI 兼容的聊天请求curl -N -X POST http://localhost:52415/v1/chat/completions \ -H Content-Type: application/json \ -d {model: mlx-community/Llama-3.2-1B-Instruct-4bit, messages: [{role: user, content: What is AI?}], stream: true}创建实例、等待实例就绪、删除实例、从 HuggingFace 加载自定义模型等其余端点都写在 docs/api.md 里。另外 Claude Messages、OpenAI Responses、Ollama 三种 API 也原生兼容现有客户端基本可以直接指向 exo 使用。调优与避坑几个值得问的问题Q张量并行和管道并行怎么选A计算密集型场景推荐张量并行把权重均匀切到多台设备同时计算这就是 2 机 1.8 倍、4 机 3.2 倍加速的来源内存放不下的场景用管道并行把模型层分布到不同设备。拿不准时可以先用/instance/previews端点列出该模型在当前集群的所有合法拆法。Q模型太大想放外部高速存储A用环境变量指过去即可EXO_MODELS_DIRS/Volumes/ExternalSSD/exo-models uv run exoQ不同规格的设备能混着用吗A可以。拓扑感知自动并行会按每台设备的实际资源和链路状况分配任务不要求机器同构。Q同一网络有多套 exo节点互相串了A设置EXO_LIBP2P_NAMESPACE环境变量给集群指定独立命名空间实现隔离。QLinux 上性能如何A目前 Linux 走 CPUGPU 加速在开发中现阶段更适合在 macOS 上玩。写在最后建议你从手头现有的两台 Mac 起步装好、跑起来先跑一个小模型熟悉流程跑通后再扩到 4 节点用仓库自带的bench/exo_bench.py测一测大模型在张量并行下的实际吞吐。RDMA 一旦启用速度的差别会比任何图表都直观。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/31 9:13:04

Joplin 笔记管理:五端同步,数据握在自己手里

Joplin 笔记管理:五端同步,数据握在自己手里 【免费下载链接】joplin Joplin - the privacy-focused note taking app with sync capabilities for Windows, macOS, Linux, Android and iOS. 项目地址: https://gitcode.com/GitHub_Trending/jo/joplin…

2026/8/31 9:13:04

Bruno 中文使用实用指南:3 个搜索技巧快速定位 API 接口

Bruno 中文使用实用指南:3 个搜索技巧快速定位 API 接口 【免费下载链接】bruno Opensource IDE For Exploring and Testing APIs (lightweight alternative to Postman/Insomnia) 项目地址: https://gitcode.com/GitHub_Trending/br/bruno Bruno 是一款开源…

2026/8/31 9:13:04

Umi-OCR 实测:300 张照片加 536 页扫描 PDF,全程离线数字化

Umi-OCR 实测:300 张照片加 536 页扫描 PDF,全程离线数字化 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维…

2026/8/31 9:28:05

Gemini API接入与多模态实战:从调用到批量任务全解析

这次我们来看 Gemini 相关能力的最新动态。从近期的热词分布看,大家关注点集中在三个方向:Gemini 怎么用、Gemini API 怎么接、新一代模型实测表现如何。如果把这个话题拆开看,其实它对应的是三件事:模型本身的能力边界、API 服务…

2026/8/31 9:28:05

75+工具与20+技能:AI Dev Kit能做什么全清单

75工具与20技能:AI Dev Kit能做什么全清单 【免费下载链接】ai-dev-kit Databricks Toolkit for Coding Agents provided by Field Engineering 项目地址: https://gitcode.com/GitHub_Trending/ai/ai-dev-kit Databricks AI Dev Kit 是 Databricks 现场工程…

2026/8/31 9:28:05

Flue + Valkey 高速KV存储实战:新手完整的 Agent 持久化教程

Flue Valkey 高速KV存储实战:新手完整的 Agent 持久化教程 【免费下载链接】flue The sandbox agent framework. 项目地址: https://gitcode.com/GitHub_Trending/flue1/flue Flue 是一个用 TypeScript 编写的沙箱 Agent 框架(The sandbox agent…

2026/8/31 9:23:05

DQPSK调制解调Matlab仿真:从原理到误码率曲线全解析

简介:本资源是一份面向通信工程专业学生、初学者及MATLAB实践者的DQPSK调制解调完整仿真代码包,聚焦数字通信中差分四相键控的核心原理与工程实现。压缩包共7个MATLAB源文件(.m),总大小仅4KB,涵盖信号生成、…

2026/8/31 1:05:20

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/8/31 2:14:20

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/8/31 1:41:28

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/8/31 0:07:32

STM32C5设备支持包(IAR DFP)安装指南与常见坑

上一阵子在IAR里折腾一块基于STM32C5系列的新板子,工程从STM32CubeMX导出来之后怎么都编译不过。报错信息很干脆:找不到设备描述文件。跟着错误路径去查,发现指向的是一个让我愣了一下的名字:STMicroelectronics.stm32c5xx.2.1.0.…

2026/8/31 0:07:32

STM32N657 SWO引脚矛盾:CubeMX显示PB3,数据手册为PB5

拿到STM32N657这颗料的第一天,我就撞上了一个让人原地懵圈的引脚矛盾:CubeMX里清清楚楚显示SWO在PB3,翻开数据手册的引脚说明表,却赫然写着PB5。对于一个靠SWO输出调试日志吃饭的人而言,这种"工具和手册打架"…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/31 9:19:59

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/31 6:53:02

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…