发布时间:2026/7/20 11:15:02
KTransformers:2024 - 2026 更新全揭秘,实现大语言模型推理/微调高效优化! 概述KTransformers 是一个专注于通过 CPU - GPU 异构计算实现大语言模型高效推理和微调的研究项目。目前该项目从 kt - kernel 源码树中开放了面向用户的推理和监督微调SFT两项功能。 更新日志2026 年 6 月 21 日支持 MiniMax - M3 首日使用教程2026 年 6 月 17 日支持 GLM - 5.2 首日使用教程2026 年 5 月 6 日 KTransformers 亮相 2026 年巴黎 GOSIM 会议 — “边缘智能体 AI” 赛道展示 KT 在消费级硬件上的推理性能2026 年 5 月 2 日支持 DeepSeek - V4 - Flash教程2026 年 4 月 30 日 KTransformers v0.6.1 刷新 kt - kernel 推理和 SFT 文档并分别设置推理和 SFT 快速入门入口2026 年 3 月 26 日支持仅使用 AVX2 的 CPU 后端进行 KT - Kernel 推理教程2026 年 2 月 13 日支持 MiniMax - M2.5 首日使用教程2026 年 2 月 12 日支持 GLM - 5 首日使用教程2026 年 1 月 27 日支持 Kimi - K2.5 首日使用教程SFT 教程2026 年 1 月 22 日支持 CPU - GPU 专家调度、原生 BF16 和每通道 FP8 精度以及 AutoDL 统一微调与推理2025 年 12 月 24 日支持原生 MiniMax - M2.1 推理教程2025 年 12 月 22 日支持使用 LLaMA - Factory 进行 RL - DPO 微调教程2025 年 12 月 5 日支持原生 Kimi - K2 - Thinking 推理教程2025 年 11 月 6 日支持 Kimi - K2 - Thinking 推理教程和微调教程2025 年 11 月 4 日 KTransformers 微调与 LLaMA - Factory 集成教程2025 年 10 月 27 日支持昇腾 NPU教程2025 年 10 月 10 日集成到 SGLang路线图、博客2025 年 9 月 11 日支持 Qwen3 - Next教程2025 年 9 月 5 日支持 Kimi - K2 - 0905教程2025 年 7 月 26 日支持 SmallThinker 和 GLM4 - MoE教程2025 年 7 月 11 日支持 Kimi - K2教程2025 年 6 月 30 日支持 3 层GPU - CPU - 磁盘前缀缓存重用2025 年 5 月 14 日支持英特尔 Arc GPU教程2025 年 4 月 29 日支持 AMX - Int8、AMX - BF16 和 Qwen3MoE教程2025 年 4 月 9 日实验性支持 LLaMA 4 模型教程2025 年 4 月 2 日支持多并发教程2025 年 3 月 15 日支持 AMD GPU 上的 ROCm教程2025 年 3 月 5 日支持 unsloth 1.58/2.51 位权重和 IQ1_S/FP8 混合权重在 24GB 显存下为 DeepSeek - V3 和 R1 支持 139K 更长上下文2025 年 2 月 25 日为 DeepSeek - V3 和 R1 支持 FP8 GPU 内核支持更长上下文2025 年 2 月 15 日更长上下文24GB 显存下从 4K 提升到 8K且速度稍快15%最高达 16 个词元/秒更新文档和在线书籍2025 年 2 月 10 日在单24GB 显存/多 GPU 和 382G DRAM 上支持 Deepseek - R1 和 V3速度最高提升 3 - 28 倍详细展示案例和复现教程见此处2024 年 8 月 28 日将 DeepseekV2 所需显存从 21G 降至 11G2024 年 8 月 15 日更新注入和多 GPU 的详细教程2024 年 8 月 14 日支持 llamfile 作为线性后端2024 年 8 月 12 日支持多 GPU支持新模型 mixtral 8*7B 和 8*22B支持 GPU 上的 q2k、q3k、q5k 反量化2024 年 8 月 9 日支持 Windows 原生系统。 功能 推理 - 高性能 kt - kernel 服务为异构大语言模型推理提供 CPU 优化的内核操作。关键特性针对 INT4/INT8 量化推理采用英特尔 AMX 和 AVX512/AVX2 优化内核实现 AMX/AVX 加速。通过支持 NUMA 的内存管理实现高效的混合专家推理进行混合专家MoE优化。CPU 端支持 INT4/INT8 量化权重GPU 端支持 GPTQ 的量化支持。为 SGLang 和其他框架提供简洁的 Python API易于集成。快速开始cd kt - kernelpip install .应用场景用于大型 MoE 模型的 CPU - GPU 混合推理。与 SGLang 集成用于生产服务。实现异构专家放置热门专家放在 GPU冷门专家放在 CPU。性能示例模型硬件配置总吞吐量输出吞吐量DeepSeek - R1 - 0528 (FP8)8×L20 GPU Xeon Gold 6454S227.85 词元/秒87.58 词元/秒8 路并发[ 完整文档](链接待补充) 监督微调SFT - 与 LLaMA - Factory 进行微调KTransformers 与 LLaMA - Factory 集成用于超大型 MoE 模型的微调。关键特性通过 INT8/INT4 量化实现 CPU/GPU 混合微调支持多后端。在有限的 GPU 内存下微调如 DeepSeek - V3/R1 等模型支持超大型 MoE。在基准测试的 MoE SFT 工作负载中训练速度比 ZeRO - Offload 快 6 - 12 倍。在基准测试设置中CPU 内存约为之前 KT SFT 路径的一半具备更低的 CPU 内存。与流行的微调框架无缝集成实现 LLaMA - Factory 集成。性能数据模型GPU 内存训练速度硬件DeepSeek - V3约 80GB 总计3.7 迭代/秒4x RTX 4090DeepSeek - R1约 80GB 总计3.7 迭代/秒4x RTX 4090Qwen3 - 30B - A3B约 24GB 总计8 迭代/秒1x RTX 4090快速开始cd /path/to/LLaMA - Factorypip install -e .pip install -r requirements/ktransformers.txtCUDA_VISIBLE_DEVICES 0,1,2,3 accelerate launch \ --config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \ src/train.py \ examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml[ 快速开始](链接待补充) [ 完整文档](链接待补充) 引用如果您在研究中使用了 KTransformers请引用我们的论文inproceedings{10.1145/3731569.3764843, title {KTransformers: Unleashing the Full Potential of CPU/GPU Hybrid Inference for MoE Models}, author {Chen, Hongtao and Xie, Weiyu and Zhang, Boxin and Tang, Jingqi and Wang, Jiahao and Dong, Jianwei and Chen, Shaoyuan and Yuan, Ziwei and Lin, Chen and Qiu, Chengyu and Zhu, Yuening and Ou, Qingliang and Liao, Jiaqi and Chen, Xianglin and Ai, Zhiyuan and Wu, Yongwei and Zhang, Mingxing}, booktitle {Proceedings of the ACM SIGOPS 31st Symposium on Operating Systems Principles}, year {2025} } 贡献者与团队由清华大学 MADSys 实验室、Approaching.AI、9#AISoft 社区贡献者开发和维护。我们欢迎贡献请随时提交问题和拉取请求。 社区与支持GitHub 问题报告错误或请求功能微信群见 archive/WeChatGroup.png KT 原始代码原始集成的 KTransformers 框架已存档到 archive/ 目录以供参考。目前该项目从 kt - kernel 源码树中整理出上述两项功能以便更清晰地编写文档和进行维护。有关包含完整快速入门指南和示例的原始文档请参阅archive/README.md英文archive/README_ZH.md中文

相关新闻

2026/7/20 11:15:02

C++智能指针std::unique_ptr:独占所有权与RAII内存管理实践

1. 项目概述:为什么我们需要std::unique_ptr?在 C 的世界里,手动管理内存就像在雷区里跳舞,刺激但危险。你分配了一块内存(new),就必须在某个地方准确地释放它(delete)。…

2026/7/20 11:15:02

ZonyLrcToolsX:基于插件化架构的跨平台歌词下载引擎深度解析

ZonyLrcToolsX:基于插件化架构的跨平台歌词下载引擎深度解析 【免费下载链接】ZonyLrcToolsX ZonyLrcToolsX 是一个能够方便地下载歌词的小软件。 项目地址: https://gitcode.com/gh_mirrors/zo/ZonyLrcToolsX 在数字音乐生态系统中,歌词作为音乐…

2026/7/21 5:29:39

2024年熵密杯 Flag3 精讲:证书伪造 — CA注册 + 持有者验证缺失

🔐 2024年熵密杯 Flag3 精讲:证书伪造 — CA注册 持有者验证缺失 阅读指引:本文是"熵密杯2024年真题精析"密码系统系列的第三篇。Flag3 考察的是证书认证中的身份验证缺失漏洞——系统在登录时验证了证书链的合法性(Is…

2026/7/21 5:29:39

JSP自定义标签深度解析:从原理到实战,掌握视图层组件化核心

1. 项目概述:为什么今天还要聊JSP标签?如果你是一位JavaWeb开发者,尤其是经历过从Servlet直接拼接HTML字符串“远古时代”走过来的朋友,看到“JSP标签”这个主题,可能会觉得有些“复古”。在前后端分离、各种现代化框架…

2026/7/21 5:29:39

AI工程师面试指南:理论与实战全解析

1. AI工程师面试全景解析:从基础理论到实战技巧最近在技术社区看到不少关于AI工程师面试的讨论,作为经历过数十场AI相关岗位面试的从业者,我想系统梳理一下这个领域的面试要点。不同于传统的软件开发岗位,AI工程师的面试往往兼具理…

2026/7/21 5:29:39

编程语言那么多,为何C语言能成为最成功的语言?

诞生五十多年后,C 仍然是历史上最具影响力的编程语言之一。每年都有新语言出现,承诺更高的生产力、更强的安全性或更简洁的语法。然而 C 仍在驱动着操作系统、嵌入式设备、数据库、编译器以及无数的软件项目。 为什么一门在 1970 年代初创造的语言能够保…

2026/7/21 5:29:39

Windows重装跳过网络连接的3种方法及应答文件配置

1. Windows重装跳过网络连接界面的必要性每次重装Windows系统时,那个烦人的网络连接界面总是打断安装流程。对于需要批量部署系统的IT管理员、追求极简安装的开发者,或是单纯想节省时间的普通用户来说,这个步骤显得尤为多余。微软从Windows 1…

2026/7/21 5:24:39

C++ STL map底层原理与核心操作详解:从红黑树到性能优化

1. 项目概述:为什么你需要深入理解STL map?如果你正在学习C,尤其是从C语言过渡过来,或者正在准备面试,那么“STL容器”绝对是你绕不开的核心话题。而在众多容器中,std::map以其独特的“键值对”存储方式和高…

2026/7/20 6:33:00

Unity与Python本地通信:基于Flask的跨语言数据交换实战

1. 项目概述:为什么我们需要一个本地通信服务器?在游戏开发、数字孪生、仿真训练等众多领域,Unity作为强大的实时3D内容创作平台,其核心逻辑通常由C#驱动。然而,当我们需要进行复杂的数据分析、机器学习推理、科学计算…

2026/7/21 0:08:52

华为OD机试 新系统真题 【酒店服务记录分析】

酒店服务记录分析(C++/Go/C/Js/Java/Py)题解 华为OD机试 新系统真题 华为OD上机考试 新系统真题 7月19号 100分题型 华为OD机试新系统真题目录点击查看: 华为OD机试新系统真题题库目录|机考题库 + 算法考点详解 题目内容 你是某连锁酒店的数据分析师,酒店每天都会用一串编…

2026/7/21 0:08:52

华为OD机试 新系统真题 【小明的顺风车】

小明的顺风车(C++/Go/C/Js/JAVA/Py)题解 华为OD机试新系统真题 华为OD上机考试新系统真题 7月19号 200分题型 华为OD机试新系统真题目录点击查看: 华为OD机试新系统真题题库目录|机考题库 + 算法考点详解 题目内容 小明自驾回家,为节省旅途成本,决定在网上挂出顺风车服务…

2026/7/20 19:08:28

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…