【Bug已解决】[Feature Request][CUDA] QMoE: support block-wise quantized expert weights (block_size > 0) …

发布时间:2026/9/29 23:32:02

【Bug已解决】[Feature Request][CUDA] QMoE: support block-wise quantized expert weights (block_size > 0) … 【Bug已解决】[Feature Request][CUDA] QMoE: support block-wise quantized expert weights (block_size 0) 解决方案一、现象长什么样用 ONNX Runtime 的 QMoE量化 MoE在 CUDA 上跑专家权重被block-wise 量化block_size 0比如每 128 个权重一组一个 scale的模型。要么加载失败要么跑出错误结果——当前 CUDA QMoE 只支持per-tensor / per-channel量化不支持 block-wiseimport onnxruntime as ort # 专家权重是 block-wise 量化block_size128每 128 个元素一个 scale sess ort.InferenceSession(qmoe_blockwise.onnx, providers[CUDAExecutionProvider]) # 报错或不支持CUDA QMoE 未实现 block_size 0 的反量化路径最小信号block_size 0per-channel/per-tensor- CUDA QMoE 正常 block_size 0block-wise - CUDA QMoE 不支持/结果错注意这是功能缺口feature request不是崩溃。CPU 端可能已支持 block-wise但 CUDA 端没实现对应反量化内核。二、背景MoE 专家权重量化时scale 的粒度决定了精度与速度的平衡per-tensor整个权重一个 scale最快但精度最低。per-channelper-output-row每个输出通道一个 scale精度较好。block-wiseblock_size N如 128每 N 个连续权重共享一个 scale。N 越小精度越高每组动态范围更一致N128 是常见甜点。block-wise 在 GPTQ/AWQ 等权重量化里非常普遍。block-wise 的反量化要求内核按块取 scale权重被切成长度为block_size的块每块有一个 scale和可能的 zero_point反量化时W_deq[i] W_q[i] * scale[block_index(i)] zp[block_index(i)]。CUDA QMoE 当前的反量化内核只实现了“全局/按行 scale”的索引方式scale 形状是[num_experts, inter]之类按输出通道取没有实现“按块偏移取 scale”——即scale的形状变成了[num_experts, inter * hidden / block_size]内核需要用i / block_size作为 scale 索引而旧内核用的是i / hidden_size行索引。于是 block-wise 模型要么不被识别、要么 scale 取错 - 结果错。三、根因根因是CUDA QMoE 反量化内核只支持按行per-channel取 scale没有实现按块block-wise,block_size0取 scale 的索引逻辑scale 索引方式不对per-channel 时 scale 索引 rowblock-wise 时 scale 索引 i / block_size。CUDA 内核写死了按row取遇到 block-wise 的[num_experts, inter*hidden/block_size]形状 scale 时索引越界或错位反量化用错 scale。block_size 参数未透传内核没接收/使用block_size属性默认按 0per-channel处理。只影响 block-wiseper-tensor/per-channel 路径照常工作所以问题只在block_size0时暴露。CPU 端若已实现 block-wise则更凸显 CUDA 端缺口。所以这不是数值错在支持的粒度下而是CUDA QMoE 缺 block-wise 反量化的实现导致该粒度模型不可用/出错。四、最小可运行复现下面用 NumPy 模拟“block-wise 反量化scale 索引按块而非按行”的差异import numpy as np def dequant_per_channel(wq, scale): 旧 CUDA 内核按行输出通道取 scale。 # scale 形状 [inter,] 每输出行一个 return (wq.astype(np.float32)) * scale.reshape(-1, 1) def dequant_blockwise(wq, scale, block_size128): 正确 block-wise按块取 scale。 out np.zeros_like(wq, dtypenp.float32) for i in range(0, wq.shape[1], block_size): blk slice(i, i block_size) s scale[:, i // block_size].reshape(-1, 1) out[:, blk] wq[:, blk].astype(np.float32) * s return out if __name__ __main__: inter, hidden 4, 256 block_size 128 wq np.random.randint(-8, 8, size(inter, hidden), dtypenp.int8) # block-wise scale 形状[inter, hidden//block_size] scale np.random.rand(inter, hidden // block_size).astype(np.float32) 0.5 correct dequant_blockwise(wq, scale, block_size) # 旧内核如果用 per-channel scale 形状会直接报错形状不匹配这里演示索引不同 print(block-wise 反量化输出形状:, correct.shape) # 验证第 0 块用 scale[:,0]第 1 块用 scale[:,1] assert np.allclose(correct[:, :block_size], wq[:, :block_size].astype(np.float32) * scale[:, 0].reshape(-1, 1))跑出来block-wise 反量化按i // block_size取 scale每块用各自 scale旧内核按行取会形状不匹配或取错。这复现了“block-wise 需要按块索引 scale”的机制。五、解决方案第一层最小直接修复最小修复给 CUDA QMoE 反量化内核加上 block-wise 路径按i/block_size取 scale透传block_size参数。对使用者临时规避是把模型重导出为 per-channel/per-tensor 量化牺牲一点 block-wise 精度换 CUDA 支持# 导出时把 QMoE 专家权重的量化粒度从 block_size128 改成 per-channel # 用量化工具把 block-wise scale 上采样/合并成 per-channel scale # 或在推理时强制 CPU EP 跑若 CPU 已支持 block-wise import onnxruntime as ort sess ort.InferenceSession(qmoe_blockwise.onnx, providers[CPUExecutionProvider])对 ORT 仓库侧修复是改 CUDA QMoE 内核dequant时若block_size 0用element_idx / block_size作为 scale 索引并正确加载[num_experts, inter, hidden/block_size]形状的 scale 张量。这一层立刻让 block-wise 模型在 CUDA 上可用且正确。六、解决方案第二层结构性改进把“QMoE 支持的量化粒度”收口成唯一的配置对象OrtQmoeBlockwiseCudaPolicy加载与内核选择读它from dataclasses import dataclass, field from typing import Tuple, Literal dataclass(frozenTrue) class OrtQmoeBlockwiseCudaPolicy: CUDA QMoE 量化粒度支持的单一事实来源。 # 已支持的量化粒度 supported_granularities: Tuple[str, ...] (per_tensor, per_channel, block_wise) # block-wise 的默认块大小 block_size: int 128 # 各粒度对应的 scale 索引方式 scale_index_mode: Tuple[str, ...] (scalar, row, block) # 受影响 EP ep: str CUDAExecutionProvider def scale_index(self, granularity: str) - str: m {per_tensor: scalar, per_channel: row, block_wise: block} return m[granularity] def describe(self) - str: return CUDA QMoE 支持 per_tensor/per_channel/block_wise按块索引 scale POLICY OrtQmoeBlockwiseCudaPolicy() def plan_qmoe(granularity: str, policy: OrtQmoeBlockwiseCudaPolicy POLICY) - str: assert granularity in policy.supported_granularities return policy.scale_index(granularity)所有 QMoE 加载与内核选择读同一份POLICYblock-wise 成为一等公民新增粒度必须实现对应 scale 索引。七、解决方案第三层断言 / CI 守护把“block-wise 在 CUDA 上正确反量化”做成断言。下面用 pytest 风格守护复用第四节逻辑import numpy as np def test_blockwise_supported(policy): assert block_wise in policy.supported_granularities def test_block_scale_index(policy): assert policy.scale_index(block_wise) block def test_dequant_blockwise_correct(): inter, hidden, bs 4, 256, 128 wq np.random.randint(-8, 8, size(inter, hidden), dtypenp.int8) scale np.random.rand(inter, hidden // bs).astype(np.float32) 0.5 out dequant_blockwise(wq, scale, bs) assert np.allclose(out[:, :bs], wq[:, :bs].astype(np.float32) * scale[:, 0].reshape(-1, 1)) def test_block_size_positive(policy): assert policy.block_size 0这四组断言锁住(1) block-wise 已支持(2) scale 按块索引(3) block-wise 反量化数值正确(4) block_size 为正。CI 跑通即代表 CUDA QMoE block-wise 被正确支持。八、排查清单遇到 CUDA QMoE block-wise 模型不支持/结果错确认量化粒度block_size 0即 block-wiseper-channel 正常 - 锁定 block 路径缺失。看 scale 索引CUDA 内核是不是按行取 scale没按i/block_size取。查 block_size 是否透传内核有没有接收block_size参数。临时规避重导出为 per-channel或暂用 CPU EP若已支持 block-wise。根本修复CUDA 内核加 block-wise 路径按块索引 scale。统一策略对象用OrtQmoeBlockwiseCudaPolicy固化粒度支持。CI 守护断言 block-wise 支持、scale 按块索引、数值正确。九、小结[Feature Request][CUDA] QMoE: support block-wise quantized expert weights (block_size 0)的根因是CUDA QMoE 反量化内核只实现了 per-tensor / per-channel按行取 scale的路径没有实现 block-wiseblock_size0按i/block_size取 scale的索引逻辑block_size参数也未透传导致 block-wise 量化如 GPTQ/AWQ 常见的块量化的模型在 CUDA 上不可用或结果错。最小修复是给 CUDA QMoE 内核加 block-wise 反量化路径按块索引 scale、透传block_size临时规避是重导出为 per-channel 或暂用 CPU EP结构性改进是用唯一的OrtQmoeBlockwiseCudaPolicy固化粒度支持CI 用四组断言守护“block-wise 支持、scale 按块索引、数值正确、block_size 为正”。记住block-wise 量化的精髓是按块取 scaleCUDA 内核必须实现i/block_size索引否则精度与可用性都丢。
延伸阅读

更多相关文章

2026/9/26 4:35:39

OpenAI Build Hours微调实战:提升模型性能的完整步骤与技巧

OpenAI Build Hours微调实战:提升模型性能的完整步骤与技巧 【免费下载链接】build-hours Build hours code to share. 项目地址: https://gitcode.com/gh_mirrors/bu/build-hours OpenAI Build Hours项目提供了丰富的微调实战代码,帮助开发者通过…

2026/9/21 9:56:13

数据库技能包,覆盖KES开发、迁移与运维全流程

近日,**电科金仓在Gitee社区发布了一套KES技能包——一套面向AI编程助手的金仓数据库专业技能包。**首批共上线31个技能,把金仓数据库(KES)相关的产品知识、操作方法和实践经验,整理成智能体能够识别和调用的专业技能。…

2026/9/30 4:36:39

JEV 玩贪吃蛇:每秒 3 步,模型到底判断了什么?

JEV 玩贪吃蛇:每秒 3 步,模型到底判断了什么? 我做了一个 JEV 玩贪吃蛇 的案例:蛇每走一步,就把当前局面变成一道选择题,让判断模型给出方向和四个选项的概率。贪吃蛇适合拿来试这个思路,因为问…

2026/9/30 4:36:39

Linux系统运维能力体检:137道场景化面试题解析

1. 这不是题库,是Linux系统运维能力的体检报告“Linux系统运维面试题大全(137道题)”——看到这个标题,别急着去背答案。我干了12年Linux一线运维,带过37个新人,筛过2100多份简历,也坐在面试官位…

2026/9/30 4:36:39

EMQX ACL权限管控实战:MQTT主题通配符与授权配置指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 4:36:39

ASCII码表本质是键值对:从查表到理解编码,提升调试效率

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 4:36:39

ICEM CFD二维结构化网格生成:流动传热仿真精度基石

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 4:31:39

Spring Boot医疗服务平台毕设:从数据库设计到源码部署指南

最近好几个学弟学妹都在问同一个毕设题目:springboot医疗服务平台。说实话,这类题目在计算机毕业设计里出现频率极高,但大多数人都卡在同一个地方——不是不会写代码,而是不知道怎么把“医疗服务平台”这几个字变成一张张表、一个…

2026/9/29 11:07:23

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/29 21:48:03

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/29 7:00:49

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 0:01:22

MATLAB+Yalmip+CPLEX实战:综合能源系统优化调度全流程解析

做综合能源系统优化调度这活儿,最痛苦的不是建模本身,而是模型写完之后不知道该怎么求解。看论文里轻飘飘一句“采用Yalmip调用CPLEX求解”,自己上手时却往往卡在环境配置、变量声明、约束写法和求解状态判读上,一耗就是两三天。这…

2026/9/30 0:01:22

I3C比I2C快10倍?RK3576实战:速率、DTS配置与混合总线避坑指南

I3C 比 I2C 快 10 倍?这句话在嵌入式群里传了很久,每次都能吵出一堆截图。前段时间我正好在 RK3576 上调板级 I3C 接口,从控制器寄存器一路摸到 Linux DTS 配置,踩了不少坑,也把这笔速度账彻底算明白了。本文就用 RK35…

2026/9/30 0:01:22

字符串转对象:JSON.parse、new Function与URLSearchParams

“字符串转对象”这几个字,我在技术群里见过的问法至少有十几种:有人拿着一串{a:1,b:2}说 JSON.parse 直接报错,有人要从 URL 里抠出参数,还有人只是想把abc变成能挂属性的东西。js 这门语言里,字符串和对象之间的转换…

2026/9/29 3:53:39

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/29 9:46:12

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/29 6:36:14

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑