发布时间:2026/8/26 17:55:16
大模型本地部署神器的瘦身进阶原理,就这两招? 温馨提示另有配套视频版附带图解演示观感不同欢迎到各大视频平台搜索同名标题或【蛋先生说识】开场丹尼尔蛋兄本地跑大模型有啥好工具推荐不蛋先生Ollama 啊装上就能用丹尼尔跟你聊多了忍不住想问——它的实现原理是什么蛋先生哈哈底层靠的是 llama.cppOllama 只是站在它肩膀上的众多应用之一丹尼尔llama.cpp上次听你讲量化原理可在各平台搜索《你瘦不下来但大模型可以量化原理了解一下》的时候好像听过这个词蛋先生没错本地算力有限不量化根本跑不动。llama.cpp 在量化算法优化这块上还是下了不少功夫的丹尼尔量化原理我是懂了个大概那今天就跟我讲讲 llama.cpp 在量化上的优化呗性价比之王Q4_K_M蛋先生llama.cpp 的量化类型有不少有 I-QuantsK-Quants 等等。而 K-Quants 又可分为 Q4_K_MQ5_K_M 等等丹尼尔等等等等。。。你就挑一个最有代表性的讲就好了我听不了这么多的名词蛋先生作为技术男性价比肯定是首位。那就 Q4_K_M 吧用得最多官方也默认推荐丹尼尔Q4_K_M 各表示啥蛋先生Q4 表示使用 4 位来量化权重K 表示使用 K-Quant 优化算法类型M 表示中等平衡核心优化一混合精度丹尼尔哦那具体都优化了啥蛋先生核心就两点。第一点混合精度Mixed Precision。大模型是一层一层摞起来的深度学习里深度俩字就是这么来的。如果每一层都用 INT4那就是吃大锅饭——一刀切。不管哪层更重要统统一个待遇丹尼尔咦就有点像埋没人才的意思蛋先生对喽大锅饭养不出尖子生好钢得用在刀刃上丹尼尔那怎么区别对待蛋先生给重要层的一些关键张量多分点精度比如 5 位或 6 位丹尼尔张量是啥蛋先生我就简单科普一下说多就扯远了。张量Tensor是数值和数组的通用叫法。数值就是标量比如1.11维数组就是向量比如[1.1, 2.2, 3.3]、2维数组就是矩阵比如[[$1.1, 2.2], [3.3, 4.4]]等丹尼尔大概明白了。那大模型哪些层是更重要的然后这些层的哪些张量是更关键的蛋先生┐(´-)┌ 这是另一个深度话题了就不展开了。顺嘴提一句 - 现在大模型基本都是 Transformer 架构注意力层Attention Layer肯定算重要层之一丹尼尔行所以结论是大部分层权重 4 位像注意力层这种重要层的一些关键张量就给更多位精度比如 5 位或 6 位这就是混合精度蛋先生总结到位核心优化二两级分组双重量化丹尼尔那第二点呢蛋先生第二点更硬核——两级分组加双重量化丹尼尔等等我觉得你有必要说下分组是怎么肥事先蛋先生上次聊量化再次提示可在各平台搜索《你瘦不下来但大模型可以量化原理了解一下》的时候结尾有提到。简单理解就是把所有权重分成多个分组进行量化丹尼尔哦结尾啊好像有点印象了。算了我等会再去翻翻。那两级怎么讲蛋先生把分好的分组内部再进行一次分组不就两级了嘛 (˘ᵕ˘)第一次分组的组叫超级块Super-block每个超级块含 256 个权重参数[ w0 w1 w2 ... w255 ] [ w256 w257 ... w511 ] [ ... ] └──── 超级块 1 ─────┘ └──── 超级块 2 ─────┘ 256 个权重参数 256 个权重参数然后再在每个超级块内部再进行一次分组分成 8 个子块每个子块包含 32 个权重参数└─────────────────── 超级块256 个权重参数────────────────────┘ └──── 子块 1 ─────┘ └──── ... ─────┘ └──── 子块 8 ─────┘ 32 个权重参数 32 个权重参数 32 个权重参数丹尼尔哦听是听懂了但为什么要这么干呢直接按 32 个权重参数一组一次分了不就完事了吗[ w0 w1 ... w31 ] [ w32 ... w63 ] [ ... ] [ w480 ... w511 ] └──── 分组 1 ────┘ └──── 分组 2 ────┘ └──── 分组 16 ────┘ 32 个权重参数 32 个权重参数 32 个权重参数蛋先生这就又得说回量化原理了。不太熟悉量化原理的同学你暂且可以用对称加密来简单理解提示不一样的东西哈只是借用了把 A 转成 B把 B 转回 A 这一相同特性来说明而已。对称加密是不是得有一个密钥来解密丹尼尔当然蛋先生在量化中密钥就是缩放因子scale和偏移量min - 仅非对称量化需要。“密钥”是需要存储的我们先来算一笔帐假设有 512 个权重参数按每 32 个权重参数一组分一共有 16 个组每个组要记两个“密钥”信息假设都用 FP16那么所有密钥得用FP16 * 2 * 16 32 * 2 * 64 512 位而所有的权重参数如果按 INT 量化也就4 * 512 位丹尼尔啊模型不就又又又胖回去了蛋先生对所以得怎么处理呢丹尼尔难道是把“密钥”也压量缩化了蛋先生猜对了这就是双重量化。它不直接用 FP16 存子块的“密钥”而是把它们再量化成 6-bit 整数。但我们知道对“权重参数”量化需要“权重参数密钥”那对“权重参数密钥”量化就需要“权重参数密钥的密钥”丹尼尔好绕口蛋先生哈哈那把它放在哪好呢肯定是往上一级放是吧。那没有上一级怎么办那就创造上一级也就两级分组咯。结果就是每个超级块额外存两个高精度 FP16 的权重参数密钥的密钥用来把那些 6-bit 的 “权重参数密钥” 还原回来。既保精度又压体积丹尼尔这样能省多少蛋先生用刚刚的示例再来算一笔帐512 个权重参数按 256 个权重参数进行一级分组一共有 2 个超级块它们存放的所有“权重参数密钥的密钥”大小为FP16 * 2 * 2 64 位每个超级块按 32 个权重参数一组一组分同样一共有256 / 32 * 2 16 个子块所有子块的“权重参数密钥”大小为6 * 2 * 16 192 位“密钥”总共消耗64 192 256 位对比只进行一级分组 512 位的消耗足足节省了一半丹尼尔我捋一下……超级块存 2 个 FP16子块的只存 2 个 6-bit靠超级块这两把钥匙还原。是这个意思吧蛋先生正是。总结一下子块分组小32 个精度保住了双重量化又压住了元数据的体积膨胀。这就是平衡的艺术——在精度和体积之间找到那个性价比天花板丹尼尔多么精巧的设计啊服了写在最后亲们都到这了要不点赞 / 收藏 / 关注支持下呗 o(▽)

相关新闻

2026/8/26 17:55:16

一.一、rocky linux安装k8s1.29.2

一、准备机器 准备3台虚拟机(都是4核4G) IP地址主机名角色192.168.11.101k8s-masterMaster192.168.11.102k8s-node1Node192.168.11.103k8s-node2Node 二、环境初始化 1、配置网卡 配置master网卡 [rootk8s-master01 run]# cat /etc/NetworkManager…

2026/8/26 17:50:15

腾讯科恩实验室 一面 三

一、主流 LLM 开发框架对比围绕“开发—部署—应用”三个层次,几款主流框架的定位如下:框架定位核心优势适用场景Ollama本地轻量化部署一键加载、内置 Web UI、极简上手个人本地实验、快速原型验证vLLM高性能推理PagedAttention、超高并发吞吐生产级 API…

2026/8/26 18:50:41

阿里巴巴国际站运营科普:平台逻辑、关键要素与增长路径

1. 阿里国际站是什么 阿里巴巴国际站是阿里巴巴集团旗下面向全球市场的B2B跨境电商平台,致力于连接中国供应商与海外采购商。自上线以来,平台逐步从早期的信息展示与商机撮合,演进为覆盖交易、支付、物流、通关等环节的数字化外贸基础设施。…

2026/8/26 18:50:41

一文学完linux必要点

本文仅作为了解使用linux。(个人笔记) 目录 一、linux认知与命令格式 1、 命令格式 1)选项的两种风格: 2)帮助系统 二、文件与目录操作 1、浏览与定位 1)ls 2)cd 2、创建操作 3、删除…

2026/8/26 18:45:40

Deep Learning for Computer Vision——Recurrent Neural Networks

第一部分:为什么需要 RNN?(序列建模问题)传统 CNN 和全连接网络(FC)的输入和输出大小是固定的(比如 224x224 的图片输入,输出 1000 个类别)。 但现实中有很多任务输入或输…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 11:48:27

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 16:56:43

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/26 0:04:32

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 1:19:35

JSON总结

JSON概念 JSON(JavaScript Object Notation) 是一种轻量级的数据交换格式,主要用于跟服务器进行交换数据。它基于ECMAScript的一个子集。 JSON采用完全独立于语言的文本格式,但是也使用了类似于C语言家族的习惯(包括C、C、C#、Java、JavaScr…

2026/8/26 1:19:35

保存连接sse 是什么原理,为什么不会一直请求

“保持连接”用的是 SSE(Server-Sent Events),本质是一个没有马上结束的 HTTP 请求。 过程是: 拷贝机发送一次请求: GET /api/code-sync/events服务器返回: Content-Type: text/event-stream但不关闭响应&…

2026/8/24 13:42:17

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/24 18:13:48

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/25 1:08:14

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…