vLLM 请求调度全解:一条 Prompt 从排队到出字的 5 个关卡

发布时间:2026/9/13 18:17:58

vLLM 请求调度全解:一条 Prompt 从排队到出字的 5 个关卡 vLLM 请求调度全解一条 Prompt 从排队到出字的 5 个关卡【免费下载链接】vllmA high-throughput and memory-efficient inference and serving engine for LLMs项目地址: https://gitcode.com/GitHub_Trending/vl/vllmvLLM 请求调度决定了哪个请求先上 GPU 显存、显存不够时谁被请出去是 LLM 推理服务里的指挥台。读完这篇你能说清一个请求的完整旅程显存告急、响应变慢时也知道该拧哪个旋钮。从一次 API 调用说起假设你部署了一个 vLLM 服务往/v1/chat/completions甩了条请求。接下来几百毫秒里你的 prompt 其实要闯 5 个关卡进等待队列请求落到 waiting 队列。默认按到达顺序排队启用优先级策略后则按 (优先级, 到达时间) 入堆抢显存块KV 缓存按块管理默认每块 16 个 token调度器每步都为请求分配它需要的块预填充整段 prompt 一次算完或者按 token 预算切成若干块分批算逐 token 解码每个调度步给这个请求生成一个新 token直到撞上max_tokens或结束符收尾释放块归还块池请求从运行队列里摘掉调度逻辑就住在引擎核心进程里下图能帮你把位置对上——vLLM 请求调度相关的 Scheduler 就挂在 EngineCore 这一步先记个印象v1 调度器里没有预填充阶段/解码阶段的分区概念每个请求只有已算了多少 token和一共要算多少 token两个数每步尽量让前者追上后者。就这一套机制同时覆盖了分块预填充、前缀缓存、投机解码。排队规则——谁先跑、谁后跑假设你一口气甩进来 10 个请求。谁先跑vLLM 给了两种排队策略由policy参数控制fcfs默认就是先来后到队列是个双端队列头部先进来的人先出队priority堆排序priority值越小越先跑对和直觉可能相反同优先级再比到达时间你可能会发现光靠这两种策略还不够长请求和短请求混排时还得靠分块预填充来救场。几种典型组合的效果场景调度行为效果10 个请求都同等重要默认 fcfs按到达顺序出队公平直观但队首一条长预填充会堵住后面 9 个其中 2 个是高优先级policyprioritypriority 值小的先跑高优先级插队低优先级的等待时间变长1 个长请求 9 个短请求长请求被切成多块短请求在块间隙插入长请求不再独占一个完整 prefill 步至于连续批处理一句话就能说清老请求每跑完一个 token新请求立刻插进当前批次不用等整批跑完。这也是为什么 vLLM 的实际吞吐比静态批处理高出一截——GPU 的空档期被压缩到了几乎看不见的程度。显存坐不下了分块、挪座、抢座把 GPU 显存想成一桌有限的座位KV 缓存就是坐上去的人。座位按块发满了就得挪座、抢座。座位怎么分块大小和水印KV 缓存被切成固定大小的块block_size默认 16。KV 缓存块大小怎么调记住权衡就行块越小显存利用越精细但管理开销和块表越大块越大最后一块可能浪费到 15 个 token 的座位。多数场景默认值就够用显存极度紧张时才考虑动它。另一个容易忽略的旋钮是watermark默认 0.0即不留余量。它的用法很具体只在新请求或被抢占的请求想进运行队列时生效要求新请求需要的块 预留的余量块都得有空闲才放行。已经坐在座位上的运行中请求不受它管。满了怎么挪交换去 CPU 是上一代的做法在 V0 时代显存不够可以把请求的 KV 缓存 swap 到 CPU 内存继续等位。但翻一下现在的 v1 调度器代码你会发现这条路被拆了——当前的抢占就是释放块、回等待队列重算没有 swap 这个中间态。如果你需要把 KV 挪到别的机器或远端存储那走的是 KVConnectorKV offloading、P/D 分离这套独立的扩展机制不是调度器内置动作。挪座的代价一句话被重算的请求它已经 prefill 过的那几千个 token 的 KV 全得从头算长上下文下这不是小数目。实在没座怎么抢preempt 怎么选人当新请求分配块失败时调度器会挑一个牺牲者踢出去fcfs 下选运行队列里最后进来的那个priority 下选 (优先级, 到达时间) 最大的那个——也就是最不该优先伺候的。两种思路的对比帮你把概念捋直swap 是 V0 的选项V1 默认走 recompute思路保留了什么代价适用场景SWAPV0 传统做法KV 缓存挪到 CPU 内存占 CPU 内存 来回搬运时间长上下文、CPU 内存宽裕RECOMPUTEV1 现行做法什么都不留prefill 算力从头再花一遍上下文不算太长、抢占预期不频繁vLLM 显存不够怎么办答案就在这三层先分块复用、再留 watermark 余量、最后才 preempt 重算。平时把水位控制好抢座动作根本轮不到出场。两个典型场景的应对长文本别一锅炖分块预填充怎么配场景 A用户甩来一篇 8000 token 的长文让你总结。如果 prefill 一锅炖这 8 千 token 会占满好几个调度步的预算其他请求的解码全得干等。实际跑起来之后你会发现enable_chunked_prefill默认就是开着的长文按每步剩余 token 预算切片每步只算其中一块默认上限就是max_num_batched_tokens2048块与块之间穿插着别的请求的解码谁也不卡谁。你可以这样调max_num_batched_tokens从默认 2048 提到 4096~8192长文 prefill 的总步数直接减半long_prefill_token_threshold默认为 0不限制设成 2048~4096 可以给长请求单独限流防止单条长文一步吞掉大半预算长文本多到离谱时顺手看一眼max_num_seqs默认 128别让一批里塞满长请求秒杀流量200 个请求突然涌入场景 B秒杀开始了200 个请求 3 秒内涌进来。这时候队列是你的第一道防线运行队列装不下max_num_seqs个多出来的老实排队再配上watermark留出余量块能避免刚放进一个请求就得马上抢座的抖动代码注释管这个叫 thrashing。如果还想在门口设闸max_num_queued_reqs可以限制在途请求总数超了直接回 HTTP 503 让客户重试到别的实例——这是最粗暴也最有效的容量阀。你可以这样调watermark设 0.01~0.05预留 1%~5% 的空闲块抢占频率肉眼可见地降下来max_num_queued_reqs按DP 实例数 × max_num_seqs 期望排队深度估一个值给队列封顶有 VIP 请求时切policypriority让付费用户的请求有资格插队上手前先看这几个旋钮参数管什么默认值什么时候该动它max_num_batched_tokens每步调度的 token 总预算2048长 prefill 太慢、或想给 prefill 更多份额max_num_seqs运行队列并发请求上限128并发上不去想换吞吐block_size每个 KV 块的 token 数16显存碎片化明显时watermark放行新请求时预留的空闲块比例0.0抢占/重算日志刷得太频繁policy排队规则 fcfs / priorityfcfs出现有优先级的请求long_prefill_token_threshold长请求单步 token 上限0不限长请求长期霸占预算max_num_queued_reqs在途请求上限超了回 503不限想让队列别把服务拖死三条踩坑提醒block_size不是越小越好设太大会让每个请求的最后一块白白占掉显存座位watermark只是新请求入门时的刹车不会把运行中的人踢下去别指望它治运行队列太挤priority是数值越小越先跑把 0 留给最重要的请求别按数值大重要去配想再往深处走直接打开vllm/v1/core/sched/scheduler.py从schedule()方法读起——先调度 running 队列、再消化 waiting 队列的完整逻辑都在里面排队策略的两种实现则在vllm/v1/core/sched/request_queue.py。对照着上面这张图走一遍源码vLLM 请求调度的家底你就算摸清了个别默认值可能随版本调整以实际版本为准。【免费下载链接】vllmA high-throughput and memory-efficient inference and serving engine for LLMs项目地址: https://gitcode.com/GitHub_Trending/vl/vllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/13 18:17:58

如何用 folly result<T> 替代异常返回并用 or_unwind 传播错误

如何用 folly result替代异常返回并用 or_unwind 传播错误【免费下载链接】folly An open-source C library developed and used at Facebook. 项目地址: https://gitcode.com/GitHub_Trending/fol/folly 在 C 服务代码里,如果你希望某些关键路径不再抛异常、…

2026/9/13 18:12:58

基于PyTorch的农作物病虫害识别:迁移学习与图像分类实战

简介:农作物病虫害识别系统是一份基于机器学习(Python)的完整毕业设计项目,适合计算机、人工智能等相关专业学生用于课程设计、论文实验或期末项目,也适合作为图像分类入门的工程范例。资源共477个文件,压缩…

2026/9/13 19:13:01

企业财务管理核心模块与信息化实践指南

1. 企业财务管理业务概述企业财务管理是企业运营的核心支柱,它涵盖了资金筹集、投资决策、运营资金管理和利润分配等关键环节。作为企业管理者必备的核心能力,财务管理水平直接决定了企业的生存发展和市场竞争力。现代企业财务管理已从传统的记账核算&am…

2026/9/13 19:08:01

SSM框架开发疫情防控管理系统实战指南

1. SSM疫情防控管理系统概述SSM疫情防控管理系统是基于SpringSpringMVCMyBatis框架开发的一套综合性疫情管理平台。这个系统在2020年疫情爆发后开始被广泛应用,目前已经成为社区、学校和企业进行常态化疫情防控的重要工具。作为一个完整的Java Web项目,它…

2026/9/13 0:01:16

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/13 0:01:16

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/12 6:29:36

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/12 14:32:17

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/13 11:18:28

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码