PD 分离架构深度解析:大模型推理如何从‘单体‘走向‘分体‘

发布时间:2026/9/29 13:33:51

PD 分离架构深度解析:大模型推理如何从‘单体‘走向‘分体‘ PD 分离架构深度解析大模型推理如何从单体走向分体![封面](https://picsum.photos/seed/17862416583336/800/400)2026 年 8 月由开源推理引擎 SGLang 孵化的 RadixArk 官宣完成超 1 亿美元种子轮融资同月AI 推理平台 Baseten 估值从 21 亿美元飙升至 130 亿美元Fireworks 在 7 个月内估值翻 4 倍达到 175 亿美元。当大模型竞赛从训练全面转向推理与部署一个底层架构正在被重新设计——它就是 PD 分离Prefill/Decode DisaggregationPrefill/Decode 分离。一、为什么推理会卡先理解 Prefill 与 Decode大模型生成一句话看似一气呵成实际上包含两个资源特征截然不同的阶段• **Prefill预填充**一次性并行处理全部输入 Token构建 KV Cache。它是高并行度的矩阵乘法属于**计算密集型**Compute-bound任务追求吞吐算力利用率越高越好。• **Decode解码**基于 KV Cache 逐 Token 生成输出每一步都要读写整段 KV Cache属于**内存带宽密集型**Memory-bound任务对延迟极其敏感用户感知的打字速度就取决于它。传统单体架构把两个阶段放在同一批 GPU 上混跑问题随之而来长 Prompt 的 Prefill 会瞬间吃满计算单元正在逐字生成的短请求被迫陪跑反过来Decode 的高频小步迭代又会拖慢 Prefill 的吞吐。两类负载互相踩脚的结果是GPU 的算力与带宽永远无法同时跑满——计算密集的时候带宽闲置带宽密集的时候算力闲置。二、为什么是现在推理优化成为 2026 年主战场这一轮 PD 分离热并非偶然而是模型竞赛重心转移的必然结果• **资本用脚投票**AI 推理平台 Baseten 估值从 21 亿美元暴涨至 130 亿美元、年收入增长 20 倍Fireworks 在 7 个月内估值翻 4 倍达到 175 亿美元、年化营收突破 10 亿美元。2026 年 8 月由开源推理引擎 SGLang 孵化的 RadixArk 正式亮相宣布完成超 1 亿美元种子轮融资并推出开源后训练框架 Miles——把训练与推理放进同一套系统统一调度让 SGLang 在推理端持续产出高质量思维链样本、Miles 在训练端实时更新权重消除阶段切换的等待损耗。• **推理引擎三年三级跳**早期的静态 Batching 像排队打饭一个算完才轮到下一个Continuous Batching连续批处理让 GPU 变成随时上下客的公交吞吐提升 2~4 倍而 PD 分离则是在此之上的第三次跃迁——不再把 Prefill 和 Decode 塞在同一张卡上互相拖累。• **头部玩家全部入局**DeepSeek 用 32 张 GPU 组成 Prefill 最优单元专门处理输入一旦开始逐字回答就通过高速网络把任务交给专门的 Decode 卡集群月之暗面 Kimi、NVIDIA Dynamo 框架、SGLang、vLLM 均已落地或原生支持 PD 分离。国内方面京算Token 工厂、趋境科技、中昊芯英须臾TPU 也都在 2026 年 7 月密集发布了 PD 分离相关实践。三、PD 分离把两种负载拆到不同的 GPU 池PD 分离的核心思想非常朴素既然 Prefill 吃算力、Decode 吃带宽那就把它们分别部署到特性不同的硬件上各自独立调度。• **Prefill 池**由高性能 GPU 组成专注快速吞下输入产出 KV Cache• **Decode 池**由高带宽、更经济的 GPU 组成专注逐 Token 生成• 中间通过高速网络RDMA/InfiniBand把 KV Cache 从 Prefill 节点交接给 Decode 节点。两个池可以独立扩缩容聊天场景输出长、输入短就多配 Decode 卡文档分析场景输入长就多配 Prefill 卡。DeepSeek 在生产环境中正是用 H800 80GB 做 Prefill 节点、用更便宜的 L40S 做 Decode 节点实现成本的差异化配置。据 NVIDIA、超擎数智等联合测试PD 分离可让 Token 吞吐提升 2~3 倍、推理硬件成本下降 30%~50%。四、代码实践一个最小的 PD 分离服务下面这段代码完整可运行演示了 PD 分离的架构机制请求先进 Prefill 池完成编码KV Cache 交接后交给 Decode 池独立生成两个池各自拥有独立的 worker 数量天然支持异构扩缩容。#!/usr/bin/env python3 极简 PD 分离服务演示Prefill 池与 Decode 池分离 KV Cache 交接 from dataclasses import dataclass, field from typing import Optional dataclass class Job: 一个推理请求 rid: int prompt: list[int] # 输入 token 序列 output: int # 要生成的 token 数 kv_cache: Optional[dict] field(defaultNone, reprFalse) class PrefillPool: 计算密集型把整段 prompt 一次性编码为 KV Cache def __init__(self, n_workers: int): self.n_workers n_workers def run(self, job: Job) - None: # 真实场景里这里是高并行矩阵乘法此处用 dict 模拟 KV Cache job.kv_cache {K: [fk{i} for i in job.prompt], V: [fv{i} for i in job.prompt]} print(f [Prefill] req#{job.rid} 编码 {len(job.prompt)} token → KV Cache 就绪) class DecodePool: 带宽密集型逐 token 生成每一步都要读完整 KV Cache def __init__(self, n_workers: int): self.n_workers n_workers def run(self, job: Job) - list[str]: assert job.kv_cache is not None, KV Cache 尚未由 Prefill 池产出 out [] for i in range(job.output): # 模拟注意力读一遍 KV内存带宽占用再吐 1 个 token _ sum(len(v) for v in job.kv_cache[V]) out.append(ftok_{i}) print(f [Decode] req#{job.rid} 生成 {len(out)} token) return out class PDServer: PD 分离调度请求先进 Prefill 池KV 交接后交给 Decode 池 def __init__(self, prefill_workers: int 2, decode_workers: int 4): self.pool_p PrefillPool(prefill_workers) self.pool_d DecodePool(decode_workers) self.kv_ready: list[Job] [] # KV 交接区 def handle(self, job: Job) - None: print(f收到 req#{job.rid} (prompt{len(job.prompt)}, output{job.output})) self.pool_p.run(job) # ① Prefill 池处理 self.kv_ready.append(job) # ② KV Cache 通过高速网络交接 self.pool_d.run(job) # ③ Decode 池独立消费 if __name__ __main__: server PDServer(prefill_workers2, decode_workers4) jobs [Job(rid1, prompt[7] * 200, output50), # 文档分析长入短出 Job(rid2, prompt[9] * 30, output120), # 聊天短入长出 Job(rid3, prompt[3, 1, 4] * 40, output30)] for j in jobs: server.handle(j)运行结果如下可以看到每个请求都走完了Prefill 编码 → KV 交接 → Decode 生成的完整流水收到 req#1 (prompt200, output50) [Prefill] req#1 编码 200 token → KV Cache 就绪 [Decode] req#1 生成 50 token 收到 req#2 (prompt30, output120) [Prefill] req#2 编码 30 token → KV Cache 就绪 [Decode] req#2 生成 120 token 收到 req#3 (prompt120, output30) [Prefill] req#3 编码 120 token → KV Cache 就绪 [Decode] req#3 生成 30 token五、工程落地绕不开的 KV Cache 传输与两层调度PD 分离不是把机器拆开就完事真正的难点在调度与传输1.两层调度第一层是全局请求分发层用一致性哈希把请求映射到 Prefill 组第二层是 Prefill 组内的细粒度负载均衡。Kimi、DeepSeek 的推理平台均采用类似设计。2.KV Cache 压缩与传输KV Cache 体积与上下文长度成正比跨节点传输会带来额外延迟。主流解法包括MLAMulti-head Latent Attention把 KV 压缩到传统 MHA 的 1/8Chunked Prefill 边算边传让 Decode 尽早开始KV Cache Offload 把冷数据放到 CPU/SSD腾出显存支持更多并发。3.Continuous Batching 仍是地基PD 分离是在连续批处理之上的架构演进两者是叠加关系而非替代关系。NVIDIA Dynamo、SGLang、vLLM 等框架已原生支持 PD 分离建议从成熟框架起步而非自研。部署侧的一个示意不同硬件规格拆分两个池# 示意将异构 GPU 拆分到两个池以 SGLang Router 为例参数以实际版本为准 # Prefill 池4 × 高性能计算卡负责长 Prompt 编码 sglang.launch_server --model-path Qwen/Qwen2.5-72B-Instruct \ --dp 4 --role prefill --port 30000 # Decode 池8 × 高带宽经济卡负责逐 Token 生成 sglang.launch_server --model-path Qwen/Qwen2.5-72B-Instruct \ --dp 8 --role decode --port 30001 # 路由层一致性哈希分发 KV 交接 sglang.launch_server --router-only --prefill-port 30000 --decode-port 30001六、挑战与选型建议• 日请求量百万级以上的推理服务PD 分离几乎是必选项小规模单机部署反而会因网络开销得不偿失。• 底层硬件的异构性与软件栈不兼容是当前最大的工程挑战也是京算 Token 工厂等国产算力平台着力攻克的难点。• 关注 2026 年 WAIC 上中昊芯英须臾TPU 等原生适配 PD 分离调度芯片的进展硬件与框架协同优化正在成为新趋势。总结从 vLLM 解决跑得起来到 PD 分离解决跑得经济大模型推理正在从单体黑盒走向可编排的分布式服务。理解了 Prefill 与 Decode 的资源差异你就抓住了 2026 年推理优化这条主线的钥匙——算力很贵把每一分钱花在刀刃上才是这个时代真正的工程智慧。
延伸阅读

更多相关文章

2026/9/29 2:37:54

SkyWalking Agent性能调优与生产环境实践

1. SkyWalking Agent性能测试背景 在分布式系统监控领域,SkyWalking作为一款开源的APM(应用性能管理)工具,其Agent组件的性能表现直接影响着生产环境的稳定性。最近在帮某电商平台做微服务改造时,我们遇到了一个典型问题:接入SkyW…

2026/9/22 8:45:40

UE5视频处理性能优化:线程调度、渲染整合与内存管理实战

1. 项目概述:UE5视频处理性能困境的根源与破局做实时渲染和交互应用的朋友,尤其是用UE5的,估计都遇到过视频处理的“老大难”问题。场景里放个视频墙,或者做个AR/VR的实时视频融合,帧率说掉就掉,延迟高得离…

2026/9/27 6:43:28

Higress云原生网关:AI驱动与生产实践解析

1. Higress 加入 CNCF 的技术意义 作为云原生计算基金会(CNCF)的新晋项目,Higress 的加入标志着开源社区对下一代 Ingress 控制器技术路线的认可。这个基于 Envoy 代理构建的网关解决方案,正在重新定义现代应用流量管理的标准范式…

2026/9/29 13:29:53

英语情景教学Agent架构设计与工程落地

1. 为什么“英语情景教学Agent”不能只靠一个大模型调用就完事?我去年带一个教育科技团队做AI口语陪练产品时,第一版原型就是简单把用户语音转文字丢给大模型,再把回复转成语音播出来。表面看流程跑通了:学生说“Where’s the nea…

2026/9/29 13:29:53

YOLOv11遥感建筑物检测:多尺度小目标优化实战

简介:这份PDF文档面向遥感图像处理与目标检测方向的学习者、研究人员及工程实践者,聚焦YOLOv11在多尺度建筑物检测中的训练技巧与数据增强方案,帮助读者应对复杂遥感场景下小目标漏检、尺度差异大、样本稀缺等实际问题。文档共38页&#xff0…

2026/9/29 13:29:53

重庆会议室舞台音响灯光选购与部署实战指南

很多刚接手会议室或小型活动场地搭建的朋友,常会遇到这样的尴尬:花大价钱买的音响设备,开会时却听不清人声,甚至产生刺耳的啸叫;灯光打下来,要么嘉宾脸上阴影重重,要么屏幕反光严重看不清 PPT。…

2026/9/29 13:29:53

AI大模型赋能数字化林业平台:从巡护日志到智能问答的落地实践

简介:这份PPT方案面向林业信息化管理者、智慧林业方案设计者及AI大模型行业应用研究者,系统梳理了AI大模型赋能数字化林业平台的建设路径,帮助读者理解如何将大模型能力落地到林业资源管理场景。资源包共1个pptx文件,大小约442KB&…

2026/9/29 11:07:23

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/28 6:05:15

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/29 7:00:49

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/29 0:04:04

AI Evals实战指南:从零搭建LLM应用评估体系与CI/CD集成

1. 为什么AI Evals值得你花时间搞明白做LLM应用的人,迟早会撞上同一堵墙:模型输出飘忽不定,今天答得好好的,明天换个问法就胡说八道。你改了一版提示词,感觉好像好了点,但到底好了多少?说不清。…

2026/9/29 0:04:04

Java采购管理系统实战:从数据库设计到事务一致性

简介:这是一套面向Java Web初学者与课程设计者的采购管理系统完整源码,采用JSP技术搭建,配合MySQL数据库,用于解决企业采购信息的管理问题,适合作为毕业设计、课程大作业或进销存类项目的参考模板。系统实现了用户登录…

2026/9/29 3:53:39

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/29 9:46:12

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/29 6:36:14

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑