发布时间:2026/8/31 10:38:15
4台家用Mac能跑671B大模型?exo多设备AI集群本地部署完整指南 4台家用Mac能跑671B大模型exo多设备AI集群本地部署完整指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo家里那台内存不够的大模型跑不起来别急着买显卡exo 是一个把你所有设备连成 AI 集群的开源框架装完自动组网、自动分片让大模型跑到单台设备根本装不下的大模型上。读完这篇你能拿到✅ 120 个模型卡的真实支持清单附硬件门槛✅ 从 clone 到跑通的最小 6 步路径✅ RDMA 组网、量化、离线模式等 5 条直接能用的调优建议一句话看懂 exo把闲置设备拼成你的本地推理集群exo 的核心机制就一句话每台设备各装一份 exo它们自动互相发现然后把模型按拓扑智能切分——哪台内存大就多放点哪台连得近就少传数据。它的默认推理后端是苹果的 MLX所以 Mac 是最佳搭档Linux 也能跑只是目前走 CPU。官方展示效果4 × 512GB M3 Ultra Mac Studio 同时跑 DeepSeek v3.18-bit和 Kimi-K2-Thinking4-bit集群视图就长这样。能跑哪些模型120 模型卡清单和硬件门槛exo 用 TOML「模型卡」描述每个模型层数、显存占用、是否支持张量并行内置的推理模型卡都在 resources/inference_model_cards/ 目录里目前 123 个。挑几个有代表性的类别代表模型模型卡路径硬件门槛典型用途超大 MoE LLMDeepSeek-V3.1671B8bitmlx-community--DeepSeek-V3.1-8bit.toml约 712GB需 4×512GB Mac超长上下文推理超大 MoE LLMQwen3-235B-A22B8bitmlx-community--Qwen3-235B-A22B-Instruct-2507-8bit.toml数百 GB建议 4 台 Mac智能对话、Agent旗舰思考模型Kimi-K2-Thinking4bitmlx-community--Kimi-K2-Thinking.toml多台设备分摊深度思考、代码70B 级 LLMLlama-3.3-70B-Instruct4bitmlx-community--Llama-3.3-70B-Instruct-4bit.toml约 40GB2 台 32GB 设备即可日常对话、写作单台可跑 LLMQwen3-30B-A3B4bitmlx-community--Qwen3-30B-A3B-4bit.toml16~32GB 单台 Mac轻量问答视觉多模态Qwen3-VL-4B-Instruct4bitmlx-community--Qwen3-VL-4B-Instruct-4bit.toml单台 16GB 即可图文理解图像生成FLUX.1-dev / Qwen-Imageresources/image_model_cards/需开启EXO_ENABLE_IMAGE_MODELS文生图、图生图除了内置清单你还能从 HuggingFace 拉任意 mlx 格式模型exo 会自动读 config.json 生成模型卡逻辑在 src/exo/shared/models/model_cards.py。重点拆解三个决定体验的功能自动发现与拓扑感知分片模型怎么被切到多台设备这是 exo 最核心的「大脑」。启动后设备自动互相发现无需手动配 IP随后 master 节点根据实时拓扑各设备剩余内存 每根链路的延迟/带宽算出最优切分方案实现入口在 src/exo/master/placement.py。你不用指定哪台放哪层/instance/previews接口会列出所有合法摆放方案让你挑内存不均也没关系它按「实时视图」分配大内存设备自动多扛常见坑设备时间/OS 版本不一致时可能发现失败RDMA 集群尤其要求系统版本完全一致张量并行 雷电 RDMA加机器反而更快传统管线切分加机器只是「装得下」exo 支持张量并行Tensor Parallelism2 台设备提速约 1.8 倍、4 台约 3.2 倍而且 macOS 26.2 起支持 Thunderbolt 5 上的 RDMA设备间延迟降低 99%。实测截图来自 Jeff Geerling 的评测Qwen3-235B8-bit在 4 × M3 Ultra Mac Studio 上跑张量并行 RDMA。支持设备M4 Pro Mac Mini、M4 Max Mac Studio / MacBook Pro、M3 Ultra Mac Studio开机前长按电源进恢复模式终端执行rdma_ctl enable再重启即可坑点设备间必须用 TB5 线全互联Mac Studio 上以太网口旁边那个 TB5 口不可用四种主流 API 全兼容你现有的工具直接能用exo 的 API 同时实现了OpenAI Chat Completions、Claude Messages、OpenAI Responses、Ollama四种格式接口都在http://localhost:52415。也就是说 ChatGPT 客户端、Claude 客户端、OpenWebUI 这类现成工具把 base URL 指过去就能用一行代码不用改。端点细节见 docs/api.md。从零到跑通6 步搭起你的第一个多设备 AI 集群装环境git clone https://gitcode.com/GitHub_Trending/exo8/exomacOS 上建议装好 Xcode 后用 brew 装uv、noderust 用 rustup 装 nightly装了 Nix 的话nix run .#exo一条命令跳过大部分步骤构仪表盘cd dashboard npm install npm run build启动节点每台设备都跑uv run exoAPI 和仪表盘起在http://localhost:52415自动组网同一网络内的节点互相发现无需手动配置懒人直接brew install --cask exo装 macOS 菜单栏版选模型仪表盘里搜索可搜 HuggingFace点选后按推荐的摆放方案创建实例等它返回 ready开始用网页里直接聊或用 curl 打/v1/chat/completions格式和 OpenAI 完全一样性能调优普通用户马上能做的 5 件事全互联 开 RDMA → 加机器真的变快TB5 线把所有设备两两连上并启用 RDMA张量并行才能在 4 台设备上拿到 3.2 倍提速否则只能退化为普通组网优先选 4bit 量化版本 → 省一半内存同一模型 8bit 和 4bit 的模型卡通常并存设备内存吃紧时直接换 4bitDeepSeek 671B 从 712GB 直接砍半把模型盘指到外接 SSD → 下载和加载都快设EXO_MODELS_DIRS/Volumes/ExternalSSD/exo-models默认盘满了会自动落到第一个空间够的目录低配机器用--no-worker加入 → 没显卡也能入伙只跑协调和组网不跑推理让家里老设备当「指挥员」用 exo-bench 跑一轮基准 → 数据说话uv run bench/exo_bench.py --model 模型 --pp 128,512 --tg 128对比不同摆放的 prompt/生成 tps 和峰值内存工具在 bench/exo_bench.py 离线环境记得EXO_OFFLINEtrue只加载本地已下载模型避免每次启动去访问 HuggingFace。写在最后exo 把「多设备跑大模型」从折腾组网、手动切分的事变成了装完即用的事自动发现、自动分片、兼容你手里所有 API 客户端。家里几台 Mac 凑一凑671B 级模型也不是只能仰望的玩具。下一篇我们聊聊「只用 2 台 32GB 的 MacBook怎么跑满 70B 模型还不发烫」想看的先点个收藏。 收藏本文备用关注 exo 仓库获取模型卡更新和 RDMA 支持进展——新模型支持基本是 day-0 跟进的。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/31 10:38:15

Compose中的ConstraintLayout:从入门到工程实践

这次我们来看 Jetpack Compose 声明式 UI 开发中绕不开的一个布局组件:ConstraintLayout,也就是约束布局。在 Android 原生 View 体系里,ConstraintLayout 是官方推荐的复杂布局容器,到了 Compose 中,它被封装成独立的…

2026/8/31 10:38:15

LocalAI 桌面客户端完整上手指南:零门槛本地AI部署

LocalAI 桌面客户端完整上手指南:零门槛本地AI部署 【免费下载链接】LocalAI LocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required. 项目地址: https://gitcode.com/GitHub_Trending/l…

2026/8/31 10:48:16

大学生HTML期末大作业——HTML+CSS+JavaScript美食网站(食谱)

HTMLCSSJS【美食网站】网页设计期末课程大作业 web前端开发技术 web课程设计 网页规划与设计💥 文章目录一、🏁 网站题目二、🚩 网站描述三、🎌 网站介绍四、🏴 网站效果五、🏳️ 网站代码六、&#x1f3f3…

2026/8/31 10:48:16

Midjourney V8.2编辑模型深度解析:从抽卡到可控编辑

设计师朋友最近跟我抱怨了一件事:AI 出图越来越快,但改图依然很痛苦。构图不对要重新生成,局部细节不满意要不断抽卡,好不容易得到一张接近想法的图,想微调某个元素,结果整张图跟着变了。这个痛点&#xff…

2026/8/31 10:48:16

2026 Java面试不是背八股:从原理到场景构建核心知识体系

2026 年 Java 面试,如果还在靠“背八股文”硬刚,大概率会挂得很冤。这不是说八股文不重要,而是现在的面试早就从“考结论”变成了“考理解”。面试官会先问一个看似基础的概念,然后一层一层往下追问,直到你暴露知识盲区…

2026/8/31 10:48:16

curl证书钉扎快速上手:2步防住中间人,附避坑清单

curl证书钉扎快速上手:2步防住中间人,附避坑清单 【免费下载链接】curl A command line tool and library for transferring data with URL syntax, supporting DICT, FILE, FTP, FTPS, GOPHER, GOPHERS, HTTP, HTTPS, IMAP, IMAPS, LDAP, LDAPS, MQTT, …

2026/8/31 10:48:16

Qlib前端界面:零基础上手可视化量化回测的完整指南

Qlib前端界面:零基础上手可视化量化回测的完整指南 【免费下载链接】qlib Qlib is an AI-oriented Quant investment platform that aims to use AI tech to empower Quant Research, from exploring ideas to implementing productions. Qlib supports diverse ML …

2026/8/31 10:43:15

深度学习医学影像实战:PyTorch肺炎分类系统全流程解析

简介:本资源是一个面向高校本科生的深度学习课程设计与毕业设计实践项目,聚焦胸部X光影像的肺炎二分类任务,解决医学影像中自动化、高精度辅助诊断的实际需求。压缩包共10个文件,含7个核心Python模块(如model.py构建迁…

2026/8/31 1:05:20

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/8/31 2:14:20

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/8/31 1:41:28

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/8/31 0:07:32

STM32C5设备支持包(IAR DFP)安装指南与常见坑

上一阵子在IAR里折腾一块基于STM32C5系列的新板子,工程从STM32CubeMX导出来之后怎么都编译不过。报错信息很干脆:找不到设备描述文件。跟着错误路径去查,发现指向的是一个让我愣了一下的名字:STMicroelectronics.stm32c5xx.2.1.0.…

2026/8/31 0:07:32

STM32N657 SWO引脚矛盾:CubeMX显示PB3,数据手册为PB5

拿到STM32N657这颗料的第一天,我就撞上了一个让人原地懵圈的引脚矛盾:CubeMX里清清楚楚显示SWO在PB3,翻开数据手册的引脚说明表,却赫然写着PB5。对于一个靠SWO输出调试日志吃饭的人而言,这种"工具和手册打架"…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/31 9:19:59

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/31 6:53:02

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…