发布时间:2026/8/29 11:42:14
llama-bench 测速实操:3 个参数让本地模型 tokens/s 翻倍 llama-bench 测速实操3 个参数让本地模型 tokens/s 翻倍【免费下载链接】llama.cppLLM inference in C/C项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp同一个 7B Q4_0 模型、同一块 GPU默认配置跑 13 t/s改一个参数就是 131 t/s。差的不是硬件是配置。llama-bench 是 llama.cpp 官方自带的性能测试工具把本地大模型测速这件事标准化了每次测试默认重复 5 次取平均参数还能用逗号一次扫多个值。下面按建基线 → 定位瓶颈 → 调参数 → 回归验证走一遍完整的 llama.cpp 性能测试流程。先跑一遍默认测试结论先行优化之前先用默认测试拿一组可复现的基线数据。编译好项目后直接运行git clone https://gitcode.com/GitHub_Trending/ll/llama.cpp cd llama.cpp make llama-bench ./llama-bench -m models/7B/ggml-model-q4_0.gguf默认会输出两行结果pp512处理 512 token 提示词2368.80±93.24 t/stg128生成 128 token131.42±0.59 t/s。把这两个数字记下来后面所有调优都和它对比。完整参数列表见 llama-bench 使用说明。看懂两个指标PP 和 TG结论先行表里的测试类型直接告诉你瓶颈在哪。⚡PPPrompt Processing模型读题的速度。输入 token 并行计算数值通常上千受算力和内存带宽影响大。TGText Generation答题的速度。一次解码一个 token数值通常几十到两百直接决定对话流畅度。pg两者串联-pg 512,128模拟先读题再答题的真实对话。数值是 5 次重复的平均值加标准差不含分词和采样时间是纯粹的推理速度。读法很简单backend 列显示 CPU 但你有 GPU说明层没卸干净看 -nglPP 低而 TG 正常说明算力吃不满看 -b± 波动大先关后台程序再测。如何设置 GPU 层数 -ngl结论先行-ngl 是最大的单一杠杆它决定模型有多少层卸载到 GPU。模型每生成一个 token本质是一串矩阵乘法把层放到 GPU就是让这些乘法走 GPU 的算力而不是 CPU 的慢内存路径。一行命令可以扫多个取值./llama-bench -m models/7B/ggml-model-q4_0.gguf -ngl 10,20,30,357B 模型实测变化nglpp512t/stg128t/s10373.36 ± 2.2513.45 ± 0.9335全卸载2400.01 ± 7.72131.66 ± 0.49注意中途的表现ngl30 时 TG 只有 40 t/s 左右35 层全部上 GPU 后才跳到 131 t/s约 9.8 倍——剩几层在 CPU 上就会卡住整条流水线半卸载往往比想象中慢。默认 ngl-1 就是全卸载显存装不下时再逐层调低。如何设置线程数 -t结论先行-t 只影响 CPU 部分模型全在 GPU 上时可以忽略。以物理核心数为起点往上扫./llama-bench -m models/7B/ggml-model-q4_0.gguf -p 64 -n 16 -t 4,8,16,328 核机器实测线程数pp64t/stg16t/s423.18 ± 0.0612.22 ± 0.07832.29 ± 1.2116.71 ± 0.661633.52 ± 0.0315.32 ± 0.05超过核心数后收益趋平TG 甚至回落——线程争抢吃掉了提升。这台机器的甜点是 8 线程。如何设置批处理大小 -b结论先行-b 主要影响 PP对 TG 基本无效。批大小决定模型每轮一次处理多少提示词 token长文档场景下批越大算力浪费越少从 128 提到 1024PP 速度约提升 74%。代价是占更多内存爆显存就往下调。./llama-bench -m models/7B/ggml-model-q4_0.gguf -n 0 -p 1024 -b 128,256,512,1024导出测试结果5 种输出格式结论先行默认 Markdown 表给人看自动化就用-o切换。-o md默认表格直接贴进文档-o csv导入 Excel 做透视分析-o json结构化数据含 cpu_info、gpu_info 硬件信息和每轮原始数据 samples_ts方便 Python 画图-o jsonl每条测试一行 JSON适合追加进日志文件-o sql生成建表和 INSERT 语句直接灌进 SQLite 长期追踪字段含义详见 llama-bench 源码。./llama-bench -o json bench.json ./llama-bench -o sql | sqlite3 perf.db回归验证把闭环走完结论先行调优的最后一步是用最优参数重跑第一条命令确认提升并入库留档。-r保持 5 次以上重复默认就是 5别用单次结果下结论对比多个模型时-m传多个路径即可自动做组合测试一次跑完 Q4_K 和 Q8_0 两种量化每次变更都把硬件信息和参数存进数据库下次对比才有参照测速是一个数据闭环基线、扫描、验证。现在就可以把那条默认命令跑起来先拿到你的第一组基线。【免费下载链接】llama.cppLLM inference in C/C项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/29 11:42:14

AN5358深度解析:LSM6DSR Always-on低功耗IMU实战指南

1. 项目背景与核心设计思路 1.1 AN5358到底是什么,为什么我建议你别只下载PDF AN5358是意法半导体官方发布的一篇围绕LSM6DSR这颗6轴IMU展开的应用笔记,完整标题就是“LSM6DSR: Always-on 3D accelerometer and 3D gyroscope”。这里的“Always-on”是整…

2026/8/29 11:37:13

ST25R3920B车载NFC读卡器方案:从数字钥匙到中控台实战

这两年做车载无线充电和NFC模块的项目不少,ST25R3920B这颗芯片几乎成了汽车NFC读卡器方案里绕不开的存在。前阵子刚完成一套中控台集成方案,正好借这个项目标题聊聊:为什么汽车数字钥匙偏偏选中NFC,ST25R3920B在CCC数字密钥和中控…

2026/8/29 11:37:13

后端迁移中的方案选型

后端迁移中的方案选型不少方案在演示环境里显得顺畅,进入多人协作或长期运行后才暴露问题。“后端迁移中的方案选型”关注的正是这段落差。对服务部署与分布式调用链路而言,可维护的实现不靠一句“已经处理异常”,而靠清楚的触发条件、可观察…

2026/8/29 11:57:14

MATLAB数学建模核心技能:从向量化编程到优化工具箱实战

1. 项目概述:为什么说MATLAB是数学建模的“瑞士军刀”? 如果你正准备参加数学建模竞赛,或者你的课程、科研项目里需要用到数学建模,那你大概率会听到一个名字:MATLAB。很多人把它当成一个“高级计算器”,但…

2026/8/29 11:57:14

数字电源设计实战:从STM32到STNRG的环路控制与调参指南

1. 项目概述:ST数字电源指南到底解决了什么问题做电源设计这些年,我有个很直观的感受:模拟电源方案越来越难撑住当前这个场景了。尤其是通信设备、服务器电源、工业电源这些需要快速动态响应、精细监控、多级保护和灵活配置的场合&#xff0c…

2026/8/29 11:57:14

京东2017校招编程题复盘:算法基础与边界处理的实战指南

每到校招季,总有不少人翻出前几年的大厂真题来练手。京东2017年的校招编程题,虽然过去几年了,但它的出题风格和覆盖的算法点放到今天依然很有参考价值。最近也有读者在后台问“python2025.3一级编程题题目及答案”,其实不管考题怎…

2026/8/29 11:57:14

告别手动搬运:三步实现参考文献的智能识别与论文全文一键打包

1. 科研效率革命:为什么我们需要智能参考文献工具 写论文最头疼的事情之一,就是处理参考文献。我至今记得研究生时期,为了找齐50篇参考文献,整整花了两天时间手动搜索、下载、重命名文件。直到后来发现自动化工具,才意…

2026/8/29 11:57:14

打造自己的HTML文件管理器:从file://到本地HTTP预览与索引

你是前端开发者,或者经常做活动页、邮件模板、数据可视化的工程师吗?如果是,那你大概率也有过这样一个瞬间:电脑里塞满了 demo.html、test_final_v2.html、导出报告.html,分布在桌面、下载文件夹、某个不知名的项目目录…

2026/8/29 11:52:14

轻量级工业物联网后台 iotStudio 实战:设备接入与可视化监控

简介:工业物联网的核心在于将现场设备数据高效、稳定地采集并转化为可视化监控与告警信息。传统平台部署重、成本高,而轻量级后台通过模块化设计,将设备接入、协议解析、数据存储、可视化大屏与告警管理整合到一个可快速落地的工程中&#xf…

2026/8/28 16:16:17

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/28 16:16:21

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/28 16:16:22

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/29 0:01:10

etc目录下的profile.d文件目录设置环境变量和全局脚本shell

一、设置环境变量etc目录下的profile.d文件目录 /etc/profile.d1、编写 vi test.sh文件内容# jdk变量 export ZHK_HOME/root export PATH$PATH:$ZHK_HOME/test # 可以取出来ZHK_HOME变量给ZZZ_HOME赋值 export ZZZ_HOME${ZHK_HOME}/test2、刷新 执行source /etc/profile 命令使…

2026/8/29 0:01:10

【JavaScript】内存管理-垃圾回收机制-内存泄露

内存管理 C 语言这样的底层语言一般都有底层的内存管理接口,比如 malloc()和free()。 而 JavaScript 是在创建变量(对象,字符串等)时自动进行了分配内存,并且在不使用它们时“自动”释放。释放的过程称为垃圾回收。 整…

2026/8/29 0:01:10

Labgrid-MCP:为嵌入式硬件实验室接入AI Agent操控能力

Labgrid-MCP 的目标是把 MCP(Model Context Protocol)能力延伸到真实嵌入式硬件实验室:AI Agent 通过一个标准化的 MCP Server,就能查看目标板状态、控制上电断电、复位开发板、读取串口日志,甚至执行镜像刷写。对于经…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…