Flex:ai是什么?一文看懂开源XPU虚拟化与AI训推智能调度的终极解析

发布时间:2026/9/25 6:07:48

Flex:ai是什么?一文看懂开源XPU虚拟化与AI训推智能调度的终极解析 Flex:ai是什么一文看懂开源XPU虚拟化与AI训推智能调度的终极解析【免费下载链接】flexaiFlex:ai是一个面向AI容器场景的开源项目其核心能力包含两大部分分别是XPU虚拟化和多级智能调度。其中XPU虚拟化分为本地XPU虚拟化和跨节点拉远虚拟化本地XPU虚拟化支持将1台服务器上的XPU算力卡虚拟化分割出多个虚拟算力单元实现单张算力卡在多个容器的共享。跨节点拉远虚拟化支持通过RDMA或TCP网络访问远端节点上的算力卡。多级智能调度支持对切分出的虚拟卡进行Binpack等资源级调度以及对AI训推任务进行分时调度等能力。项目地址: https://gitcode.com/ModelEngine/flexaiFlex:ai是一个面向AI容器场景的开源项目由上海交通大学、西安交通大学、厦门大学、华为等联合发起。它的两大核心能力是XPU虚拟化和多级智能调度前者能把一张物理算力卡GPU/NPU虚拟切分成多个虚拟算力单元让单张算力卡被多个容器共享后者能对切分出的虚拟卡做 Binpack 等资源级调度并对 AI 训推任务进行分时调度从而大幅提升 AI 集群的算力利用率。为什么需要Flex:aiAI集群的算力浪费难题 在实际生产环境中AI 业务集群通常是大小模型混部的场景一方面运行 DeepSeek、Qwen 系列等大模型往往独占整卡甚至多卡另一方面还有大量小参数量模型CV 模型、Embedding 模型等它们根本吃不满一张整卡。结果就是昂贵且稀缺的 GPU/NPU 资源大量闲置浪费。同时AI 工作负载千差万别如何在有限算力上高效调度大并发任务一直是业界的难题。Flex:ai 正是为此而生——项目文档中明确说明了这一动机可参见 README.md 的“动机”一节。 一句话总结让一张卡掰成多份用让多份算力被聪明地分。核心能力一XPU虚拟化本地切分 跨节点拉远XPU 是 GPU/NPU 等异构算力卡的统称。Flex:ai 的虚拟化分为两种模式1️⃣ 本地XPU虚拟化单卡多容器共享把 1 台服务器上的算力卡虚拟化分割出多个虚拟算力单元实现单张算力卡在多个容器的共享GPU 侧一张 GPU 可切分为 1~20 个 vGPU支持指定算力切分百分比5 的倍数与显存大小由 GPU-device-plugin 设备插件和 CUDA 劫持客户端完成资源管控详细说明见 GPU-Virtual-Service/README.md。NPU 侧在昇腾原生架构与 CANN 基础上深度定制支持将单张物理 NPU 虚拟化为多个不同规格的 vNPU 实例按 1:1、2:8 等比例动态切分实现硬件级资源隔离详见 Ascend-Virtual-Service/README.md。下图展示了跨节点拉远虚拟化中“租算端与算力端”的协同设计数据经共享内存解耦后再由 CUDA Wrapper 下发到远端 GPU 执行2️⃣ 跨节点拉远虚拟化GPU算力池化通过RDMA 或 TCP 网络访问远端节点上的算力卡让没有 GPU 的节点也能租到算力。该能力位于 gpu-remoting 模块通过LD_PRELOAD劫持 CUDA Runtime / Driver API以及 cuBLAS、cuDNN、NCCL 等库调用透明地把请求转发到远端执行内置调度器scheduler支持多种策略可通过 config.json 配置轮询、空闲显存、利用率等调度方法配套 Python 存储组件storage处理训练数据集的加载与共享内存传输。下面是拉远虚拟化存储模块的代码结构总览图客户端与服务端通过 ZeroMQ 通信数据集经预处理后写入共享内存核心能力二多级智能调度在虚拟化切分的基础上Flex:ai 提供两级调度能力把剩余算力压榨到极致 资源级调度Binpack 装箱调度对切分出的虚拟卡进行 Binpack 等资源级调度。GPU 场景基于 Volcano 调度器扩展调度组件vc-scheduler、vc-controller-manager、vc-webhook-manager可通过 volcano-development.yaml 一键部署到 K8s 集群。⏱ 任务级调度分时复用与优先级时间片轮转复用突破物理切分的数量限制多个 AI 任务在同一张物理卡上毫秒级时间片轮转低负载推理任务以排队抢占方式共享算力算力保障与优先级多级调度策略支持为核心业务设置高优先级关键任务优先获得算力响应降低长尾延迟。昇腾侧的调度行为由 flexnpud.conf 配置例如quota参数定义每轮调度循环允许下发算子的最大次数aicore_alloc定义每个进程在分时调度中的算力权重。快速上手体验算力切分效果 GPU虚拟化部署步骤前置安装 Helm、NVIDIA 驱动与 nvidia-container-toolkit导入调度组件镜像执行kubectl apply -f volcano-development.yaml拉起调度层打包并安装 helm chart拉起client-updateCUDA 劫持与gpu-device-plugin设备插件在业务 Pod 中申请虚拟卡资源三个参数即可参数说明huawei.com/vgpu-number申请的 vGPU 卡数huawei.com/vgpu-cores算力切分百分比0-1005的倍数huawei.com/vgpu-memory.1Gi显存占用Gi通过watch nvidia-smi或容器内gpu-monitor工具即可观察到 GPU 利用率在设定的切分百分比附近波动验证切分生效。Ascend NPU体验步骤基于华为官方vllm-ascend镜像启动容器进入 hypervisor 目录依次执行./clear.sh→./flexnpud→./register.sh启动守护进程并注册用户进程进入 aclserver 目录分别运行./server.sh与./server_2.sh启动两个推理进程通过vllm bench的吞吐结果即可观察到算力切分效果。项目结构一览 目录说明Ascend-Virtual-Service/昇腾 NPU 虚拟化hypervisor 守护进程、acl 服务端/客户端GPU-Virtual-Service/xpu-pool-service/本地 GPU 虚拟化设备插件、CUDA 劫持、xpu-exporter 监控GPU-Virtual-Service/gpu-remoting/跨节点拉远虚拟化API 劫持、调度器、存储组件GPU-Virtual-Service/yaml/Volcano 调度器部署清单总结Flex:ai 以XPU虚拟化 多级智能调度两大核心能力直击 AI 集群大小模型混部导致算力浪费的痛点本地切分让一张卡多容器共享跨节点拉远让算力像池子一样按需流动Binpack 与分时调度让每一份算力都被充分利用。无论你是 GPU 还是昇腾 NPU 用户都能在这个开源项目中找到贴合自身场景的算力共享方案。【免费下载链接】flexaiFlex:ai是一个面向AI容器场景的开源项目其核心能力包含两大部分分别是XPU虚拟化和多级智能调度。其中XPU虚拟化分为本地XPU虚拟化和跨节点拉远虚拟化本地XPU虚拟化支持将1台服务器上的XPU算力卡虚拟化分割出多个虚拟算力单元实现单张算力卡在多个容器的共享。跨节点拉远虚拟化支持通过RDMA或TCP网络访问远端节点上的算力卡。多级智能调度支持对切分出的虚拟卡进行Binpack等资源级调度以及对AI训推任务进行分时调度等能力。项目地址: https://gitcode.com/ModelEngine/flexai创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/25 6:02:48

微信小程序+Flask+Vue:家校通平台完整开发实践

这两年我接过不少家校通、校园服务类的项目,发现一个很普遍的现象:很多学校还在靠微信群来传递通知、布置作业、收发成绩,家长群一多,消息刷屏严重,老师也疲于维护。微信小程序FlaskVue这个组合,就是我在实…

2026/9/25 7:02:50

Atlas 300V NPU加速卡部署YOLOv5全流程解析

最近又一次把YOLOv5往Atlas 300V 24G上搬,整个过程下来还是有不少值得记录的东西。很多人第一次接触“atlas”这个名词时会有点懵,尤其是当你搜“atlas部署yolo”“atlas 300v 24g 是运算加速卡吗”这类问题的时候,其实核心就一句话&#xff…

2026/9/25 7:02:50

Atlas 300V 24G NPU推理卡部署YOLO模型全流程指南

1. 先搞清楚Atlas到底是什么1.1 Atlas 300V 24G的身份定位最近很多人在问“atlas部署yolo”和“atlas 300v 24g 是运算加速卡吗”,其实这两个问题指向的是同一个东西:昇腾Atlas系列里的AI推理加速硬件。Atlas是华为昇腾计算平台的产品线名称,…

2026/9/25 7:02:50

通信墙不破,AI Agent算力不立:华为超节点技术解析

开场直接上结论:这两年大家聊 AI Agent,注意力全放在模型聪明不聪明、工具调用顺不顺、提示词写得规不规范。但我自己把几个 Agent 项目从单机推到集群上之后,发现真正卡脖子的问题根本不在模型层,而在最底层的通信。算力堆得再高…

2026/9/24 20:24:47

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/23 12:06:55

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/25 0:02:35

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:02:35

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:02:35

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/22 16:34:32

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/22 20:01:30

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/22 13:25:41

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑