发布时间:2026/8/26 23:32:50
FSE技术详解:Qwen3.5-397B-A17B-MoE-MXFP4中共享专家融合的量化优化 FSE技术详解Qwen3.5-397B-A17B-MoE-MXFP4中共享专家融合的量化优化【免费下载链接】Qwen3.5-397B-A17B-MoE-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-397B-A17B-MoE-MXFP4Qwen3.5-397B-A17B-MoE-MXFP4是AMD推出的一个革命性的大语言模型它采用了先进的共享专家融合FSE技术将MoE模型中的共享专家量化到MXFP4精度并融合到路由的MoE内核中实现了显著的性能提升和内存优化。什么是FSE技术FSEFused Shared Expert技术是一种创新的模型优化方法它专门针对混合专家MoE模型的架构特点进行优化。在传统的MoE模型中共享专家通常以较高精度如BF16运行这会占用大量内存并影响推理速度。FSE技术的核心突破在于共享专家量化将共享专家从BF16精度量化到MXFP4内核融合将量化后的共享专家融合到MoE路由内核中内存优化显著减少BF16内存占用性能提升提高解码吞吐量Qwen3.5-397B-A17B-MoE-MXFP4的架构特点这个模型基于Qwen3.5-397B-A17B架构具有以下关键技术规格特性规格模型架构Qwen3_5MoeForConditionalGeneration参数量397B混合专家专家数量512个专家每token激活专家数10个隐藏层大小4096层数60层量化精度MXFP4权重和激活支持的硬件AMD MI350 / MI355MoE架构的优势 混合专家MoE架构通过以下方式实现高效推理稀疏激活每个token只激活10个专家中的一部分专家专业化每个专家专注于处理特定类型的任务参数高效虽然总参数达397B但实际激活的参数要少得多FSE技术的技术实现细节1. MXFP4量化方案Qwen3.5-397B-A17B-MoE-MXFP4采用了OCP MXFP4量化方案权重量化静态量化每32个元素为一组激活量化动态量化实时适应输入分布量化配置在config.json的quantization_config部分详细定义2. 共享专家融合机制传统的MoE架构中共享专家独立于路由专家运行而FSE技术实现了# 传统MoE处理流程 shared_expert_output bf16_shared_expert(input) routed_experts_output mxfp4_routed_experts(input) output combine(shared_expert_output, routed_experts_output) # FSE优化后的流程 fused_output fused_mxfp4_moe_kernel(input) # 共享专家已融合3. 排除层的策略在量化过程中模型保留了以下关键层的原始精度注意力机制层包括q_proj、k_proj、v_proj、o_proj门控层mlp.gate和mlp.shared_expert_gate视觉模块视觉编码器的关键层线性注意力层linear_attn.*相关层FSE技术的性能优势 内存优化效果通过将共享专家量化到MXFP4模型实现了显著的内存节省组件原始精度FSE优化后节省比例共享专家权重BF162字节MXFP40.5字节75%总内存占用约800GB约200GB75%解码内存需求高显著降低-推理性能提升在AMD MI350/MI355硬件上的测试显示解码吞吐量提升相比保持共享专家为BF16的方案提升约15-20%延迟降低由于减少了内存带宽需求端到端延迟降低能效提升更低的功耗实现相同性能精度保持能力在GSM8K基准测试中FSE技术展现了卓越的精度保持能力模型版本GSM8K准确率精度恢复率Qwen/Qwen3.5-397B-A17B-FP897.95%基准amd/Qwen3.5-397B-A17B-MoE-MXFP4 (FSE)97.27%99.31%惊人的99.31%精度恢复率证明了FSE技术在保持模型能力的同时实现了显著的优化FSE技术的实际应用部署配置示例使用SGLang框架部署Qwen3.5-397B-A17B-MoE-MXFP4python3 -m sglang.launch_server \ --model-path amd/Qwen3.5-397B-A17B-MoE-MXFP4 \ --tensor-parallel-size 4 \ --trust-remote-code \ --attention-backend aiter \ --mem-fraction-static 0.8 \ --host 0.0.0.0 --port 30000量化配置细节在config.json中关键的量化配置包括{ quantization_config: { global_quant_config: { input_tensors: { dtype: fp4, is_dynamic: true, qscheme: per_group, ch_axis: -1, group_size: 32 }, weight: { dtype: fp4, is_dynamic: false, qscheme: per_group, ch_axis: -1, group_size: 32 } } } }FSE技术的未来展望 技术演进方向更精细的量化策略针对不同专家采用不同的量化精度动态专家选择根据输入复杂度动态调整激活专家数量硬件协同优化针对AMD GPU架构的深度优化应用场景扩展FSE技术不仅适用于大语言模型还可扩展到多模态模型图像、视频、文本的联合处理边缘计算在资源受限设备上部署大型模型实时应用需要低延迟响应的场景总结Qwen3.5-397B-A17B-MoE-MXFP4中的FSE技术代表了MoE模型优化的重要突破。通过将共享专家量化到MXFP4并融合到MoE内核中该技术实现了✅显著的内存节省75% BF16内存占用减少 ✅优秀的精度保持99.31%恢复率 ✅明显的性能提升15-20%解码吞吐量提升 ✅高效的硬件利用针对AMD MI系列GPU优化这项技术为部署超大规模语言模型提供了实用的解决方案让397B参数的模型能够在相对较小的硬件配置上高效运行。随着量化技术和硬件加速的不断发展FSE技术有望在更多场景中发挥重要作用对于想要体验这一先进技术的开发者可以通过AMD-Quark工具链进行模型量化和部署享受高效推理带来的便利。【免费下载链接】Qwen3.5-397B-A17B-MoE-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-397B-A17B-MoE-MXFP4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/26 23:31:14

经典桌游《Car Wars》拆解:车辆设计、速度表与战术博弈

说起 Car Wars 这个名字,老一点儿的桌游玩家心里多半会浮现出同一个画面:一辆塞满武器和弹药的改装轿车,在六边形地图上以一百多公里的时速狂飙,被击中侧裙后轮胎爆裂、车尾扫过半个弯道,最后一头撞进路边掩体&#xf…

2026/8/26 23:31:14

谷歌VLA模型如何攻克机器人“最后几厘米”精细操作

“最后几厘米”,是机器人行业里最难糊弄过去的一截物理距离。任务规划、路径规划、物体识别都做得不错了,但机械臂一旦靠近工件,要完成插拔、卡扣、对准、稳持这些动作时,精度、力控、反馈延迟全部变成硬约束。最近谷歌机器人团队…

2026/8/26 23:31:14

MySQL面试高频考点与测试实践全解析

1. MySQL面试题核心价值解析 2026年的软件测试岗位对MySQL能力的要求已经发生了显著变化。随着云原生和分布式数据库的普及,测试工程师需要掌握的不仅是基础的CRUD操作,更要理解数据库在现代化测试体系中的关键作用。这套面试题的价值在于它精准抓住了三…

2026/8/26 23:31:14

网文改编漫剧剧本:Claude Code五阶段全自动工作流拆解

简介:在AI辅助创作日益普及的今天,如何将长篇网络小说高效转化为适合短视频传播的漫剧剧本,成为内容创作者面临的实际难题。漫剧与网文在表达载体上存在本质差异,前者依赖画面与声音,后者以文字叙述为主,单…

2026/8/26 23:26:14

复刻COSMAC ELF:用CDP1802打造上世纪70年代微电脑

COSMAC ELF 这几个字,现在看起来很像 Linux 下的 ELF 可执行文件格式,实际却是一台上世纪 70 年代 RCA 推出的经典微电脑。哪怕是搜索热词里总在说 elf、decompressing linux、parsing elf、booting the kernel,那也只是名字撞车。在复古计算…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 11:48:27

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 16:56:43

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/26 0:04:32

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 1:19:35

JSON总结

JSON概念 JSON(JavaScript Object Notation) 是一种轻量级的数据交换格式,主要用于跟服务器进行交换数据。它基于ECMAScript的一个子集。 JSON采用完全独立于语言的文本格式,但是也使用了类似于C语言家族的习惯(包括C、C、C#、Java、JavaScr…

2026/8/26 1:19:35

保存连接sse 是什么原理,为什么不会一直请求

“保持连接”用的是 SSE(Server-Sent Events),本质是一个没有马上结束的 HTTP 请求。 过程是: 拷贝机发送一次请求: GET /api/code-sync/events服务器返回: Content-Type: text/event-stream但不关闭响应&…

2026/8/26 19:34:06

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/26 19:17:08

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/26 19:34:05

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…