Jackrong-llm-finetuning-guide的24个高保真蒸馏数据集宝藏清单:CoT推理、数学、代码全覆盖

发布时间:2026/10/11 12:43:08

Jackrong-llm-finetuning-guide的24个高保真蒸馏数据集宝藏清单:CoT推理、数学、代码全覆盖 【免费下载链接】Jackrong-llm-finetuning-guide项目地址https://gitcode.com/gh_mirrors/ja/Jackrong-llm-finetuning-guide点击查看免费下载Jackrong-llm-finetuning-guide是一个面向新手的 LLM 微调Fine-Tuning教学项目其 High-fidelity Dataset/ 目录收录了24 个高保真蒸馏数据集覆盖 CoT 思维链推理、数学、STEM、代码竞赛与多轮对话五大方向全部来自 DeepSeek、Qwen3、GLM-4.7、GPT-OSS 等旗舰模型蒸馏支持一键批量下载是初学者微调大模型最值得收藏的数据集清单。 微调大模型时数据质量往往比超参数更决定效果。这套数据集最大的价值在于每个文件都来自顶级教师模型的完整推理过程Chain-of-Thought而不只是最终答案。 什么是高保真蒸馏数据集用一句话解释让最强的大模型教师把解题的完整思考过程写下来再拿这份思维笔记去训练较小的模型学生这就是模型蒸馏。这套数据的核心特点是保留完整推理链多数数据按thinking推理过程/thinking 最终答案的 CoT 格式组织让模型学会怎么想教师阵容豪华DeepSeek-V3.2-Exp、Qwen3-235B-A22B、GLM-4.7、gpt-oss-120b 等旗舰模型轮番授课✅经过清洗与质检部分数据还引入了 LLM-as-a-Judge 打分、低温采样等质量控制手段开箱即用统一 JSONL 格式与项目内的 SFT 训练 Notebook 直接配套️ 24个数据集速览总表#数据集含README教师模型方向规模/语言1Qwen3.5-reasoning-700xQwen3.5-27BCoT 推理1K / 英2glm-4.7-Superior-Reasoning-stage1GLM-4.7CoT 推理数学1K-10K / 英3glm-4.7-multiturn-CoTGLM-4.7多轮 CoT1K-10K / 英4Natural-Reasoning-gpt-oss-120B-S1gpt-oss-120b-high自然场景推理1K-10K / 英5gpt-oss-120B-distilled-reasoninggpt-oss-120b通用推理1K-10K / 英6GPT-OSS-20B-Distilled-Reasoning-Minigpt-oss-20b推理三段式质检1K-10K / 英7LogosForge-scored-sft-v1gpt-oss-120B打分式 SFT10K-100K / 英8DeepSeek-v3.1-reasoner-Distilled-math-samplesDeepSeek-V3.1数学推理1K / 英9DeepSeek-V3.2-Exp-reasoning-exampleDeepSeek-V3.2-Exp数学推导对比1K / 英10GPT-OSS-120B-Distilled-Reasoning-mathgpt-oss-120b数学解题1K-10K / 英11gpt-oss-120B-distilled-math-OpenAI-Harmonygpt-oss-120b数学Harmony格式1K-10K / 英12gpt-oss-120b-reasoning-STEM-5Kgpt-oss-120b-highSTEM 理科1K-10K / 英13Competitive-Programming-python-blend混合来源算法竞赛代码10K-100K / 英14qwen3-coder-480b-distill-miniQwen3-Coder-480B代码推理9,543 条 / 英15LogicMind-Chat-Reasoning-SFT-300KQwen3-32B大规模聊天 SFT29.6 万条 / 英16Chinese-Qwen3-235B-Thinking-2507-Distill-100kQwen3-235B-Thinking中文推理指令~10 万条 / 中17Qwen3-235B-A22B-Instruct-2507-Distilled-chatQwen3-235B多语言聊天1K-10K / 多语18ShareGPT-Qwen3-235B-A22B-Instuct-2507Qwen3-235B多轮对话英19ShareGPT-gpt-oss-120B-reasoninggpt-oss-120b多轮推理对话中/英20MultiReason-ChatAlpaca机器生成多轮指令跟随1.8 万条/15.8 万消息 / 英21Chinese-DeepSeek-V3.2-Exp-chat-exampleDeepSeek-V3.2-Exp中文真实对话6,655 轮 / 中22gpt-oss-120b-Reasoning-Instructiongpt-oss-120b推理指令英23IELTS-writing-feedback-reasoningGLM-4.7雅思写作评分1K-10K / 英24financial-economics-reasoningQwen3-235B-Thinking金融经济推理12.2 万条 / 中英 CoT 推理系7 套教模型怎么思考的数据这是全套数据中的精华区重点提升模型的分步逻辑与演绎能力⭐Qwen3.5-reasoning-700x用 Qwen3.5-27B 全参数模型生成超长 CoT 响应覆盖数学、代码、逻辑、科学四大领域glm-4.7-Superior-Reasoning-stage1GLM-4.7 低温T0.6蒸馏的 Stage1 数学推理数据采样温度低意味着推理轨迹更稳定glm-4.7-multiturn-CoTShareGPT 式多轮对话 think标签的 CoT 注入适合训练多轮推理格式Natural-Reasoning-gpt-oss-120B-S1基于 280 万题级自然推理题库STEM、经济学、社会科学的 S1 部分LogosForge-scored-sft-v1两阶段构建——先蒸馏再生成最后由 Qwen3-235B 自动打分可支持课程学习GPT-OSS-20B-Distilled-Reasoning-Mini完整演示了种子题 → 蒸馏 → 自动清洗 → LLM 评审打分的四段式质检流程gpt-oss-120B-distilled-reasoninggpt-oss-120b 通用推理蒸馏带长度分布可视化分析 数学与 STEM 系5 套高难度解题数据DeepSeek-v3.1-reasoner-Distilled-math-samples以 NVIDIA Nemotron 数学子集为种子题用 DeepSeek-V3.1 Reasoner 模式蒸馏平均推理链长达 1.7 万字符长尾分布明显DeepSeek-V3.2-Exp-reasoning-example附 208 题的 V3.2-Exp vs R1-0528 数学推导对比报告直观展示结构化推导与无显式 CoT的差异GPT-OSS-120B-Distilled-Reasoning-math字段完整拆分Input / CoT_Native_Reasoning / Reasoning / Answer方便分别做 CoT 训练与 SFTgpt-oss-120B-distilled-math-OpenAI-HarmonyOpenAI Harmony 格式版本适配不同推理框架gpt-oss-120b-reasoning-STEM-5K从纯数学扩展到科学、技术、工程全理科领域 代码与竞赛编程系2 套算法能力利器Competitive-Programming-python-blendPython 为主的竞赛编程混合集兼顾 C 与无 Agent 式 SWE 任务规模达 1 万~10 万条qwen3-coder-480b-distill-mini由 480B 参数35B 激活的 Qwen3-Coder 蒸馏从 rStar-Coder 抽取 1 万题种子、32K 上下文清洗后保留 9,543 条高质样本 指令对话系8 套多轮与多语言 SFT 数据LogicMind-Chat-Reasoning-SFT-300K全套数据中的巨无霸29.6 万条聊天样本每条含problem → 推理轨迹 → 最终答案完整结构分 4 个 part 文件存放Chinese-Qwen3-235B-Thinking-2507-Distill-100k约 10 万条中文推理与指令数据覆盖数学、知识问答、写作、编程做中文模型微调首选MultiReason-ChatAlpaca1.8 万条记录、15.8 万条消息的多轮指令跟随数据Qwen3-235B-A22B-Instruct-2507-Distilled-chat英文为主、涵盖中/俄/韩/日的多语言聊天数据ShareGPT-gpt-oss-120B-reasoning与ShareGPT-Qwen3-235B-A22B-Instuct-2507ShareGPT 式多轮蒸馏前者由 gpt-oss-120b 授课后者由 Qwen3-235B 授课Chinese-DeepSeek-V3.2-Exp-chat-example6,655 轮真实中文对话样本附输入输出长度分布报告gpt-oss-120b-Reasoning-Instruction推理 指令跟随融合数据 垂直领域系2 套面向真实业务场景IELTS-writing-feedback-reasoningGLM-4.7 生成的雅思写作 Task 2 评分数据集最大亮点是保留完整的评分推理轨迹评分可解释、可审计接近真实考官的决策过程financial-economics-reasoning12.2 万条中英双语金融经济数据用 Qwen3-235B-Thinking 蒸馏并保留完整 CoT32K 上下文窗口 最快获取方式一键批量下载 24 个数据集全部数据以 JSONL 格式存放在 High-fidelity Dataset/ 目录下仓库提供了配套工具download_datasets.py批量下载脚本自动拉取全部 24 个数据集到本地High-fidelity Dataset/目录✂️split_large_files.py大文件自动分片工具——超过 1.5GB 的 JSONL 会被切分为part01/part02/...多段文件这就是你在目录里看到sft_part01.jsonl等分片的原因训练时按顺序拼接即可本地没有克隆仓库的话执行以下命令获取完整数据git clone https://gitcode.com/gh_mirrors/ja/Jackrong-llm-finetuning-guide 从数据到训练配套 Notebook 与 PDF 指南数据集不是孤立的项目 train_code/ 目录提供了浏览器即可运行的配套训练代码模型训练方式入口Qwopus 3.5 (27B)SFTtrain_code/Qwopus3-5-27b-Colab.ipynbQwopus 3.6 (27B)GSPOtrain_code/Qwopus3.6-27B-GSPO/qwopus3_6_27b_gspo_training.pyLlama 3.2 (3B)RL (GRPO)train_code/Llama-3.2-3B-R1-Zero-GRPO.ipynb教师模型蒸馏数据加工data_processing_code/DeepSeek-v4-API-distill.ipynb此外guidePDF/Qwopus3-5-27b-Colab_complete_guide_to_llm_finetuning.pdf 提供了从环境搭建、数据准备到训练优化的一步步完整 PDF 教程适合零基础读者对照学习。 一分钟选数指南你的目标推荐数据集提升通用推理能力Qwen3.5-reasoning-700x、LogosForge-scored-sft-v1强化数学解题DeepSeek-v3.1-reasoner-Distilled-math-samples、gpt-oss-120b-reasoning-STEM-5K训练代码/算法能力Competitive-Programming-python-blend、qwen3-coder-480b-distill-mini做大规模 SFTLogicMind-Chat-Reasoning-SFT-300K29.6 万条中文模型微调Chinese-Qwen3-235B-Thinking-2507-Distill-100k10 万条中文垂直业务落地IELTS-writing-feedback-reasoning、financial-economics-reasoning这 24 个高保真蒸馏数据集的最大意义在于它们把旗舰模型的思考过程变成了普通人也能拿走的训练原料。配合项目内的训练 Notebook 和 PDF 教程即使只有浏览器和免费云环境也能完整走通一条数据 → 微调 → 部署的大模型适配之路 赞分享【免费下载链接】Jackrong-llm-finetuning-guide项目地址https://gitcode.com/gh_mirrors/ja/Jackrong-llm-finetuning-guide点击查看免费下载相关推荐Windows虚拟光驱软件选哪个WinCDEmu让你告别光盘烦恼Windows虚拟光驱软件选哪个WinCDEmu让你告别光盘烦恼 还在为ISO、CUE、NRG等光盘镜像文件发愁吗每次需要安装软件或访问光盘内容时都要找物存储驱动开发Jackrong-llm-finetuning-guide完全指南零基础也能跑通的LLM大模型微调知识库Jackrong llm finetuning guide完全指南零基础也能跑通的LLM大模型微调知识库 Jackrong llm finetuning gu三步极速蒸馏 DeepSeek R1基于 PaddleNLP 的数据蒸馏、SFT 微调与高性能推理部署全流程指南三步极速蒸馏 DeepSeek R1基于 PaddleNLP 的数据蒸馏、SFT 微调与高性能推理部署全流程指南 本篇技术指南以 PaddleNLP 仓库中人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLP创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/11 12:43:08

mobaxterm root身份登录Ubuntu

第一步:在 Ubuntu 中设置 root 密码 打开 Ubuntu 终端,执行: sudo passwd root 按提示设置 root 密码。 第二步:安装并启动 SSH 服务 执行以下命令: sudo apt update sudo apt install openssh-server -y sudo systemc…

2026/10/11 12:43:07

电脑远程监控系统的 7 个关键知识点:运维新人最容易漏掉的细节

很多新人刚接触终端管理时,容易把“远程监控”理解成简单的远程桌面或屏幕录像。实际上,企业里的电脑远程监控系统通常包含屏幕审计、远程协助、行为日志、资产盘点、告警联动等多个模块。如果只盯着“能不能看屏幕”,上线后很容易遇到合规争…

2026/10/11 14:48:17

欧瑞博智能家居全屋落地指南:从选型到交付的工程实践

简介:一份欧瑞博智能家居解决方案的完整文档,适合智能家居行业从业者、方案设计师、产品经理及技术研发人员研读。内容系统梳理欧瑞博公司背景、核心产品线(智能开关、智能插座、燃气报警器等),并重点介绍ViHome智能家…

2026/10/11 14:48:17

Flutter扫码App历史记录搜索实战:SQLite模糊查询与性能优化

1. 这次做完"历史记录搜索",我踩了哪些坑? 先说背景。我们团队基于某开源操作系统做了一款跨端扫码App,技术栈是Flutter,扫码这块用的是原生插件对接底层能力,UI和业务逻辑全部在Flutter层实现。之前版本的功…

2026/10/11 14:48:17

MySQL安装配置教程:从下载到第一条SQL的完整路径

简介:这份MySQL安装及使用教程面向数据库零基础的学习者与需要快速上手MySQL的开发人员,系统讲解从环境搭建到日常操作的完整入门路径。资源包内含1个docx文档,大小约1.53MB,以图文并茂的步骤说明为主,便于边看边练。内…

2026/10/11 14:48:17

IoT终端轨迹异常检测:轻量规则引擎与边缘特征工程实践

简介:本资源是一篇聚焦物联网移动终端用户行为分析的学术研究论文,面向计算机科学、数据挖掘与智能安防领域的研究生、科研人员及工业界算法工程师,旨在解决海量不均匀轨迹数据下异常检测效率低、精度不足的现实难题。论文提出双层层次聚类方…

2026/10/11 14:48:17

建筑光储系统规划运行综合优化:改进粒子群算法与Python实现

看到这个标题,第一反应是“这又是把某篇论文的MATLAB代码换成Python的复现活”。但真正动手之后我意识到,建筑集成光储系统的规划运行综合优化,比一般的光伏容量配置复杂得多——它不是算一个容量值就完事,而是要在“装多大”和“…

2026/10/11 14:43:17

基于PyQT6从零开始做一个计时器

前言 PyQt6 是 Qt 6 的 Python 绑定,属于第三方库,要 pip install PyQt6 才能用;本机没有安装环境,所以本文代码只能逐行推演。官方文档写明 PyQt6 要求 Python 3.9 或更高,如果你还在用 3.8,就只能退回 Py…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑