Qwen3.8-9B 数学与代码能力实测:从 GSM8K 到 MMLU 的评测结果全解读

发布时间:2026/10/5 8:37:13

Qwen3.8-9B 数学与代码能力实测:从 GSM8K 到 MMLU 的评测结果全解读 Qwen3.8-9B 数学与代码能力实测从 GSM8K 到 MMLU 的评测结果全解读【免费下载链接】Qwen3.8-9B项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwen3.8-9BQwen3.8-9B 是 Empero 团队最新发布的开源推理模型它将 Qwen3.8 2.4T A95B 大模型的数学与代码推理能力蒸馏进 9B 参数的紧凑架构。本文基于官方评测数据从 GSM8K 数学推理到 MMLU 综合能力对 Qwen3.8-9B 评测结果进行逐项解读并给出部署与使用建议。这份成绩单里有惊喜也有需要理性看待的地方读完你就知道它到底值不值得上手。一、Qwen3.8-9B 是什么9B 参数如何复刻 2.4T 大模型的推理能力先说结论Qwen3.8-9B 是一棵大树上嫁接的幼苗——它不是从零训练的而是把 Qwen3.8 2.4T A95B教师模型的思维过程完整蒸馏进了 Qwen3.5-9B 的架构学生模型。蒸馏Distillation让大模型输出高质量答案和思考过程再用这些教师轨迹去训练小模型让小模型学会大模型的推理方式而不是自己瞎猜。几个关键数字项目数值参数量9B全参数微调非 LoRA 适配器教师模型Qwen3.8 2.4T A95B训练数据约 70,000 条精选教师轨迹训练方式SFT离线蒸馏上下文长度262,144 token原生支持许可证Apache-2.0可商用架构上它继承自 Qwen3.5-9B32 层 Transformer、hidden size 4096采用线性注意力与全注意力混合的 Gated DeltaNet 设计每 4 层穿插一层全注意力详见 config.json。这意味着它在长上下文场景下内存占用更友好但运行前需要安装配套的flash-linear-attention与causal_conv1d内核。最直观的特点藏在对话模板里模型每次回答都会先输出一段think.../think思维链见 chat_template.jinja再给出最终答案——这正是从教师模型那里学来的深度思考习惯。二、Qwen3.8-9B 评测方法CoT 协议与评分口径详解评测使用的是 EleutherAI 的lm-evaluation-harnessHF 后端基座模型与蒸馏模型采用完全相同的设置保证公平对比。由于两个模型都是推理模型评测采用思维链CoT协议GSM8K使用gsm8k_cot协议MMLU使用mmlu_flan_cot_zeroshot协议覆盖全部 57 个学科、约 1,700 道题。评分口径分为两档✅Flexible-extract灵活抽取只要最终答案正确就算对是主要参考指标Strict-match严格匹配要求答案格式完全一致更严苛。采样参数统一为temperature0.6, top_p0.95, top_k20Qwen3.5 官方推荐设置完整评测表见 README.md。三、GSM8K 数学推理实测准确率全解读GSM8K 是 8,500 道小学数学应用题考察模型的多步算术推理能力是衡量数学能力最常用的基准之一。Qwen3.8-9B 的成绩如下指标Qwen3.5-9B基座Qwen3.8-9B变化exact_match灵活抽取0.8850.870−0.015exact_match严格匹配0.8750.850−0.025解读87% 的准确率依然是很强的数学推理水平但相比基座模型小幅回落了 1.5 个百分点。原因并不神秘——README 中明确指出模型学习的是教师轨迹继承了教师遇到简单题也会长篇思考的习惯过度推敲反而容易在简单题上出错。也就是说这不是能力退步而是推理风格带来的副作用。四、MMLU 综合能力实测57 学科平均分暴涨 20 个点如果说 GSM8K 是小幅波动那么 MMLU 就是质的飞跃。MMLU 覆盖 STEM、人文、社科等 57 个学科是衡量大模型综合知识面与泛化能力的黄金标准指标Qwen3.5-9B基座Qwen3.8-9B变化acc灵活抽取0.5460.7510.205acc严格匹配0.2510.5110.260解读灵活抽取得分从 54.6% 飙升至 75.1%直接提升 20.5 个百分点严格匹配得分更是从 25.1% 翻倍到 51.1%。这说明蒸馏不仅教会了模型怎么想更把教师模型庞大的知识储备和严谨的作答格式搬了过来——这是 9B 参数规模下非常惊人的结果。五、为什么数学与代码是 Qwen3.8-9B 蒸馏的重点README 里有一句话很关键训练数据的配比刻意向硬核数学与竞赛编程倾斜因为这两个领域正是蒸馏在 9B 规模下性价比最高的地方。数学GSM8K 的高分证明了多步推理能力被成功继承代码模型原生支持函数调用Function Calling无需额外的工具微调即可接入代码解释器、API 等工具配合think思维链写代码时会先想清楚再动手️工具使用对话模板内置了tool_call调用格式见 chat_template.jinja适合构建 Agent 应用。一句话总结它不是为了刷分而生而是为了在单卡上跑出大模型级别的推理表现而生。六、快速部署 Qwen3.8-9B本地运行参数与注意事项想亲自复现这份评测只需几步环境要求较新的transformers支持 Qwen3.5 架构 Gated DeltaNet 内核flash-linear-attention和匹配 CUDA 的causal_conv1d下载权重文件model.safetensors与配置文件config.json、generation_config.json运行推理时务必使用推荐的采样参数。from transformers import AutoModelForCausalLM, AutoTokenizer import torch model_id empero-ai/Qwen3.8-9B tok AutoTokenizer.from_pretrained(model_id) model AutoModelForCausalLM.from_pretrained( model_id, dtypetorch.bfloat16, device_mapauto) # 关键宽松采样 足够长的输出上限 out model.generate(inputs, max_new_tokens16384, temperature0.6, top_p0.95, top_k20, do_sampleTrue)⚠️三个使用提醒不要用贪心解码推理模型在长文本生成时贪心解码greedy容易陷入重复循环务必保持采样模式留足输出长度每次回答都有think思考块建议max_new_tokens16384前端展示时记得剥离think.../think部分纯文本微调视觉能力继承自基座模型本次评测未覆盖多模态场景。七、总结Qwen3.8-9B 评测成绩单该怎么看把两份成绩单放在一起看评测维度表现结论GSM8K 数学推理87.0%灵活抽取强小幅回落属推理风格副作用MMLU 综合能力75.1%灵活抽取暴涨 20.5 个百分点最大亮点代码与工具调用原生函数调用 竞赛编程轨迹适合 Agent / 代码场景部署成本9B 单卡可跑262K 上下文性价比极高Qwen3.8-9B 的评测结果告诉我们蒸馏路线在 9B 规模上完全走得通。它用 GSM8K 的稳定表现守住了数学推理的基本盘用 MMLU 的暴涨证明了知识迁移的威力。对于想在单卡 GPU 上获得接近大模型推理体验的开发者来说这份成绩单足够有说服力。如果你正准备把它接入自己的项目建议从 README.md 的 Quickstart 开始先复现一遍 GSM8K 与 MMLU 评测再结合业务场景调整采样参数——毕竟纸面数据终归要落到真实任务里才算数。【免费下载链接】Qwen3.8-9B项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwen3.8-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/5 18:42:41

2026 西安 GEO 优化服务商口碑推荐:真实用户评价 + 核心优势 口碑篇

核心结论 广拓时代采用GAINS增长闭环组织GEO项目,并由GTark承担品牌提及、推荐、首推、引用、情感倾向和竞品表现的持续监测。从实施角度看,从内容资产角度看,判断服务商不能只看发稿数量,还要核验事实基础、方法完整性、数据口径…

2026/10/5 18:43:04

CUB-200-2011细粒度分类实战:从数据预处理到90%+准确率

简介:图像分类是计算机视觉的基础任务,但当类别间差异细微到仅凭翅膀斑纹或羽色深浅就能区分时,普通分类模型便难以胜任。细粒度图像分类要求模型具备更强的判别性特征提取能力,而CUB-200-2011正是评估这一能力的标准基准&#xf…

2026/10/5 18:43:04

AI元人文:当学术写作被AI重塑,我们如何守住学术自觉

这几年我有个很深的感受:学术写作这件事,正在被AI静悄悄地重塑。前阵子我帮一本期刊做外审,收到一篇讨论算法伦理的投稿,结构工整、术语精准、论证链条严丝合缝,可我越读越觉得不对劲——每个段落都太“顺”了&#xf…

2026/10/5 18:43:04

5G辅助无人机优化仿真:信道建模、切换与能耗联合优化

5G这东西,玩无人机的朋友应该都有耳闻——基站拉远、图传卡顿、多机协同掉链子,这些痛点我踩过不少。这几年一直在搞蜂窝网联无人机方向的仿真,Matlab里折腾过不少轮,踩坑踩得多了,总算攒出一套算得上"高创新&quo…

2026/10/5 18:43:04

玉米黄曲霉素识别数据集与YOLOv11实战:从标注到93.8%准确率

简介:这份玉米黄曲霉素识别数据集面向从事农业病害检测、食品安全筛查的算法工程师与深度学习学习者,用于训练和验证玉米穗腐病等霉变目标的检测模型。数据均基于原始田间图片,采用YOLOv11完成人工标注,验证准确率可达93.8%以上&a…

2026/10/5 18:43:04

STM32F407改时钟频率后串口乱码?拆解PLL配置与CubeMX排查

1. 乱码不是玄学:先从症状反推时钟树配置搞嵌入式最让人抓狂的瞬间之一,就是程序烧进去之后,串口输出一堆莫名其妙的符号——要么是"烫烫烫"这种内存乱码,要么是规律的菱形问号,要么干脆是奇形怪状的ASCII字…

2026/10/5 18:38:04

Flutter路由管理实战:从Navigator机制到深链拦截与架构设计

做Flutter开发这几年,路由管理是我几乎每个项目都会重新审视一遍的东西。原因很简单:业务一复杂,页面跳转就绕不开参数传递、页面拦截、深链拉起这一堆事,而路由正是把这些乱麻理顺的核心骨架。很多人刚上手时觉得路由无非就是Nav…

2026/10/5 6:32:56

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/4 0:01:02

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/5 17:38:27

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑