AngelSlim性能基准全盘点:10+主流模型压缩效果对比与选型清单

发布时间:2026/10/10 19:10:38

AngelSlim性能基准全盘点:10+主流模型压缩效果对比与选型清单 人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载AngelSlim 是腾讯混元团队开源的大模型压缩工具包集成量化、稀疏注意力、投机采样、蒸馏等主流模型压缩算法并提供一键压缩、校准与部署能力。本文基于仓库内官方 Benchmark对 Qwen3、Hunyuan、DeepSeek-R1、Qwen-VL、GLM-4.6 等10 主流模型的压缩效果数据做全盘点并给出一份可直接照做的选型清单。想解决的问题推荐压缩方案官方实测效果显存不够、单卡跑大模型INT4-GPTQ / INT4-AWQ权重大小降至约 1/4精度普遍保留 95%精度优先的通用部署FP8-Static / FP8-Dynamic多模型精度与 BF16 基本持平超大 MoEDeepSeek-R1、Kimi-K2W4A8-FP8GPQA 78.28→77.37损失 1 分推理速度慢投机采样Eagle3 / DFlare / DFly最高 5.52× / 平均 1.98–2.40× 加速长上下文 Prefill 慢Stem 稀疏注意力LongBench v2 得分 63.4 vs BF16 65.4VLM 图片 token 太多IDPruner 视觉 token 压缩90% 压缩比下保留 85.71% 平均分一、AngelSlim 量化基准Qwen3 全系对比 仓库在 docs/source/performance/quantization/benchmarks.md 中收录了完整评测CEVAL / MMLU / GSM8K / HUMANEVAL 四大基准下表摘录 Qwen3 关键尺寸数据来自 README.md 官方 Benchmark 章节模型量化方案CEVALMMLUGSM8KHUMANEVALQwen3-8BBF16基线79.2774.7887.7963.41Qwen3-8BFP8-Static78.2374.7986.9662.20Qwen3-8BINT4-GPTQ77.1973.2686.4362.20Qwen3-8BINT4-AWQ76.1573.5986.9663.41Qwen3-32BBF16基线86.5582.0074.5337.80Qwen3-32BFP8-Static86.9281.7870.2039.63Qwen3-235B-A22BBF16基线89.6086.2885.2927.44Qwen3-235B-A22BFP8-Static89.6786.1986.9627.44三个可以记住的结论FP8-Static 是精度保持最稳的通用方案Qwen3-235B-A22B 量化后 CEVAL、GSM8K 不降反升评测波动范围内8B/14B 掉分均在 1 分以内。INT4 方案掉分 1–4 分GPTQ 与 AWQ 差距很小可按部署框架支持情况任选小模型0.6B/1.7BINT4 掉分更明显。MoE 模型对 FP8 几乎无损Qwen3-30B-A3B、235B-A22B 均保持在基线 ±0.5 分以内。Qwen3 全系含 0.6B 至 235B-A22B 共 8 个规格与 Qwen2.5 系列、DeepSeek-R1-Distill-Qwen 的完整数据可直接打开 benchmarks.md 查看量化配置则放在 configs/qwen3/ 目录下按算法分子目录管理。二、Hunyuan、DeepSeek-R1 与旗舰 MoE 模型压缩效果2.1 Hunyuan 系列0.5B ~ A13B模型方案CEVALMMLUGSM8KHunyuan-A13BBF1682.7087.3091.10Hunyuan-A13BFP8-Static83.0086.7091.10Hunyuan-A13BINT4-AWQ82.6085.6091.00Hunyuan-7BBF1676.5081.1085.90Hunyuan-7BFP8-Static76.6080.9086.00Hunyuan-7BINT4-AWQ76.4080.9085.90Hunyuan 全系 0.5B/1.8B/4B/7B/A13B 均验证通过A13BMoE在 FP8-Static 下 CEVAL 反超基线 0.3 分7B 几乎无损配置见 configs/hunyuan/。2.2 DeepSeek-R1-0528 与 W4A8-FP8 ⚡针对 DeepSeek-R1-0528 这类超大 MoE官方采用 FP8-Block-Wise 与 W4A8-FP8 双方案基于 TRT-LLM 部署 5 次运行取平均模型方案GPQA DiamondAIME 2024SimpleQALiveCodeBenchDeepSeek-R1-0528FP8-Block-Wise78.2888.6727.8077.10DeepSeek-R1-0528W4A8-FP877.3788.6726.8378.86W4A8-FP8权重 4bit 分组量化 激活 8bit FP8把权重大小再砍一半数学与代码基准几乎不掉分是超大 MoE 上“压缩率 vs 精度”的甜点方案。Kimi-K2 结构与 DeepSeek-V3 类似可直接复用该流程配置文件位于 configs/deepseek_r1/w4a8_fp8/ 与 configs/kimi_k2/w4a8_fp8/。三、多模态与新兴模型VLM、Omni、GLM、Seed-OSSQwen3-VL 视觉语言模型的 FP8 量化表现非常亮眼MMMU / DocVQA / ChartQA模型方案MMMU_VALDocVQA_VALChartQA_TESTQwen3-VL-32BBF1660.1196.0894.64Qwen3-VL-32BFP8-Static61.2296.0094.64Qwen3-VL-30B-A3BBF1650.4495.2895.36Qwen3-VL-30B-A3BFP8-Dynamic50.6795.2595.20其他多模态/新模型的基准结果模型方案基准表现Qwen2.5-VL-72BINT4-AWQMMMU 58.78与 BF16 完全持平DocVQA 94.19Qwen3-Omni-30B-A3BFP8-DynamicAIME25 73.33基线 73.32MMLU-Redux 88.07GLM-4.6FP8-StaticCEVAL 83.14基线 82.60GSM8K 93.86Seed-OSS-36B-InstructFP8-StaticGSM8K-strict 74.75基线 70.36HUMANEVAL 86.59可以看到GLM-4.6 与 Qwen3-Omni 在 FP8 下数学题得分不降反升多模态路线上 FP8 已可作为默认选项。完整数据见 benchmarks.md 的 Qwen3VL、Qwen3-Omni、GLM-4.6 章节。四、FP4 新方案NVFP4 与 INT4-GPTAQ 实测新一代 4bit 浮点方案 NVFP4 在 Qwen3 上的结果值得关注模型方案GSM8KMMLUGPQA DiamondQwen3-32BBF1667.0681.7254.04Qwen3-32BNVFP469.8780.7456.06Qwen3-235B-A22BBF1696.6362.7360.60Qwen3-235B-A22BNVFP496.1762.0960.10而 AngelSlim 自研的INT4-GPTAQQAT 风格的 INT4 算法在小模型上优势更明显Qwen3-4B 的 GPQA Diamond 从 GPTQ 的 35.35 提升到39.39甚至超过 BF16 基线37.88。两者算法说明分别见 docs/source/features/quantization/nvfp4.md 与 gptq.md。五、投机采样基准Eagle3、DFlare、DFly 与 SpecExit 推理提速方面AngelSlim 的投机采样全家桶基准收录在 docs/source/performance/speculative_decoding/benchmarks.mdEagle3LLM / VLM / 音频全覆盖Qwen3 全系平均 1.5–2.2× 吞吐提升接受长度约 2 个 token多模态场景同样有效——模型任务Vanilla 吞吐Eagle3 吞吐接受长度Qwen3-VL-4B多基准平均150.21 tok/s283.32 tok/s2.41Hunyuan-OCROmniDocBench70.12 tok/s108.10 tok/s2.08Qwen2-AudioLibriSpeech78.76 tok/s146.66 tok/s3.51DFlare块扩散投机采样在六个基准上取得Qwen3-4B 最高 5.52×、Qwen3-8B 5.46×、GPT-OSS-20B 3.91×端到端加速比 DFlash 再快 5%–11%DFlyAngelSpec 框架在 Hy3-295B-A21B 生产流量上DFly-8 在各并发档位c4–c64均为最快方案平均加速 1.98×–2.40×HumanEval 峰值2.86×高并发下叠加 D-cut 还能再提15.7%吞吐。SpecExit推理早退面向“过度思考”的推理模型通过轻量草稿模型直接预测早退信号在 GSM8K、GPQA 等推理基准上实现精度-延迟的更优折中官方结果见 spec_exit.md六、稀疏注意力与极限位宽Stem 和 1.25-bit 翻译模型Stem 稀疏注意力专攻长上下文 Prefill 阶段计算量随序列长度二次增长通过 block 级 top-k 稀疏注意力跳过冗余块。在FP8-W8A8 Stem配置下各基准与 BF16 基线基本持平基准BF16FP8-W8A8 StemLongBench v265.4063.40SWE-bench Verified74.4072.40Terminal-Bench 2.054.4054.38ClawEval55.0055.45同目录还有 MInferenceA-Shape/Tri-Shape、FlexPrefill、XAttention、FlashPrefill、VecAttention、CoSA 等多种稀疏方案配置统一放在 configs/sparse/。极限位宽Hy-MT1.5 翻译模型则是 AngelSlim 压缩能力的“秀肌肉”场景1.25-bitSherry每 4 个权重只存 3 个 1-bit 值3.3GB FP16 模型压到440MB手机离线可跑Flores-200 翻译质量与数倍参数量的大模型相当2-bitSEQ 弹性量化 QAD 蒸馏压到574MB翻译质量接近无损hy4-preview MIX-STQ1_01.5TB 大模型压至 214GiBSWE-bench Pro 仅掉0.7%。七、一分钟选型清单我的模型该压成什么格式✅你的场景首选方案备选关键证据单卡/显存紧张部署 7B–32BFP8-StaticFP8-Dynamic235B 不降分8B 掉分 1追求 4bit 高压缩INT4-GPTQINT4-AWQ / INT4-GPTAQ32B 掉分 ≤1.5AWQ 72B VLM 持平新架构 GPUBlackwellNVFP4FOCUS FP4MXFP4/NVFP4 QAT32B GSM8K 反超基线DeepSeek-R1 / Kimi-K2 级 MoEW4A8-FP8FP8-StaticAIME 不掉分LiveCodeBench 1.76生成速度慢Eagle3DFlare / DFly / SpecExit最高 5.52× 端到端加速长上下文 Prefill 延迟高StemMInference / XAttention精度与 BF16 基本持平VLM 图片 token 冗余IDPrunerVisionSelector / SCOPE90% 压缩比保留 85.71% 均分 经验法则精度敏感选 FP8显存敏感选 INT4速度敏感叠投机采样长上下文叠稀疏注意力——这几类方法在 AngelSlim 中互不冲突可组合使用如 FP8 Stem 已作为官方评测配置。八、如何复现这些基准附文件路径压缩python3 tools/run.py -c 你的配置文件配置文件在 configs/ 下按“模型/算法”组织入口脚本 tools/run.py部署改一下 scripts/deploy/run_vllm.sh 中的MODEL_PATH即可起 vLLM 服务评测scripts/deploy/lm_eval.sh 一键跑 CEVAL/MMLU/GSM8K/HUMANEVAL投机采样吞吐用 tools/dflash_benchmark.py。更多细节可查阅官方文档量化基准、投机采样基准、Stem 文档、DFlare 文档。小结从 1.8B 翻译模型到 235B MoEAngelSlim 的官方基准覆盖了 10 主流模型 × 6 类压缩算法核心结论是——FP8 保精度、INT4/FP4 省显存、投机采样与稀疏注意力提速度按上文清单对号入座即可快速完成你的模型压缩选型。赞分享人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载相关推荐InternViT-300M-448px快速上手教程3步代码提取图像特征的完整指南InternViT 300M 448px快速上手教程3步代码提取图像特征的完整指南 InternViT 300M 448px 是 OpenGVLab 开源的轻D-FINE模型压缩基准不同压缩方法性能对比分析D FINE模型压缩基准不同压缩方法性能对比分析 引言实时目标检测的压缩挑战 在边缘计算和移动设备部署场景中模型压缩已成为目标检测算法实际应用的关键技术。人工智能计算机视觉深度学习终极指南如何用Godot Voxel Tools打造专业级体素游戏世界终极指南如何用Godot Voxel Tools打造专业级体素游戏世界 在3D游戏开发的浩瀚宇宙中体素技术犹如一颗璀璨的恒星它打破了传统多边形建模的局限游戏开发3D渲染创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/10 19:05:37

可落地的时间序列Transformer模型构建指南

简介:本资源是一套基于Transformer架构实现时间序列预测的Python完整源码项目,面向高校学生、AI初学者及期末课程设计者,解决传统RNN/LSTM在长时序建模中注意力机制不足的问题,适用于金融时序(如股价、汇率&#xff09…

2026/10/10 19:05:37

Axure多角色登录原型实战:从全局变量到权限控制

刚开始接触Axure原型设计的时候,遇到“多角色登录”这种需求,我第一反应也是有点懵:不就是登录页加个下拉框,选完角色跳转到对应页面吗?等真正做完一轮再回头看,才发现这里面的坑远比想象的多。角色判断、权…

2026/10/10 21:10:50

好消息与坏消息:如何建立不被情绪绑架的消息处理机制

1. 好消息与坏消息的真相:先别急着高兴,也别急着崩溃你肯定有过这种时刻:手机一震,屏幕上弹出一条消息,你心跳加速,点开之后要么想唱歌要么想砸手机。但过了一个星期回头看,当初那个让你兴奋得整…

2026/10/10 21:10:50

WorkBuddy FDE 90天路径:从一句话需求到上线App的实战指南

一句话需求丢过来,三周后要看到能装进手机里的东西,这种场景在不少小团队里反复上演。WorkBuddy FDE 这套打法,就是冲着这种"需求模糊、时间紧、人手少"的处境来的。它把从一句话到上线 App 的全过程拆成可执行的阶段,核…

2026/10/10 21:10:50

LL(1)分析法实现IF-ELSE翻译程序:四元式与真假链回填

简介:一份面向编译原理学习者的IF-ELSE条件语句翻译程序设计资料,基于LL(1)预测分析法,完成词法分析、语法分析并输出四元式中间代码。资料以Visual Studio工程形式组织,共17个文件,包含C源码、头文件、工程配置文件&a…

2026/10/10 21:10:50

Vibe Coding实战:用Cursor+SDD+Claude Code建立可控AI开发链路

1. Vibe Coding不是让AI写代码,是在和需求反复博弈先说个大家可能都有的经历:拿到Cursor第一周,感觉很爽,让它生成个函数、写个页面,几乎都是秒出。但两周之后,项目越做越乱,AI生成的代码散落各…

2026/10/10 21:05:50

AnyPS5:跨平台异构硬件通用运行环境的设计与实现

1. 项目缘起与核心定位AnyPS5 这个名字第一次出现在我视野里的时候,我正蹲在一堆拆机件中间,手里攥着一块从旧设备上拆下来的定制主板,琢磨着怎么把它的算力榨干。当时脑子里冒出来的念头很直接:能不能做一个足够通用的软硬件框架…

2026/10/10 7:31:36

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/9 20:15:56

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/8 6:05:44

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 0:04:53

从逻辑门到计算机:数字电路核心原理与全加器搭建实战

如果你拆过一台旧电脑的主板,盯着那些黑乎乎的小芯片看上一会儿,可能会冒出同一个疑问:这堆引脚密集的元件,到底是怎么“变”出那么复杂的应用的?答案并不在某个神秘的部件里,而是在所有芯片内部都在反复使…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑