发布时间:2026/8/25 1:24:18
8GB 笔记本 39.3 tok/s、单卡跑 753B:FreeToken 把 frontier MoE 拉回本地 8GB 笔记本 39.3 tok/s、单卡跑 753BFreeToken 把 frontier MoE 拉回本地Hugging Face 每日论文2026-08-20 精选「跑不动 frontier 模型」这六个字过去一年几乎成了本地 AI 的紧箍咒——能跑的开源模型一般不超过 70B模型一大就得排队用云。UC Berkeley、UT Austin、MIT 三校联合团队 8 月 17 日挂出 arXiv 编号 2608.16157 的论文 FreeToken第一次把这件事彻底反过来8GB 显存的笔记本能以 39.3 tok/s 跑 35B 级模型单张 RTX PRO 6000 工作站卡能跑通 753B 的 GLM-5.2连 RTX 4060 笔记本都能超过 RTX 4090 的 92% 速度。论文 8 月 20 日上线 Hugging Face 每日论文并被纳入 Trending社区 48 颗星把这条「本地重新跑赢云端」的路线彻底点亮了。为什么 frontier 模型过去必须跑在数据中心MoE混合专家模型是把上千亿参数「按需激活」的设计——DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2 都是这一类。它们的特点是「总参数大、激活参数小」理论上 35B 激活量就能跑出 700B 级模型的质量。但「总参数大」这件事本身就是个工程噩梦模型权重得能常驻内存、被激活的那部分 expert 还得能从存储层流到 GPU 上算。普通笔记本 / 游戏台式机的显存装不下、带宽又不够于是 frontier 模型的推理自然就集中到了 H100 / H200 这类数据中心 GPU 上。过去几年业界做了三种尝试。第一种是 vLLM / SGLang 这一类数据中心优化框架但它们都假设 GPU 能装下整个模型本地硬件根本谈不上。第二种是 llama.cpp 走 CPU offloading把 expert 留在内存、让 CPU 算这条路在 35B 量级还行但 GLM-5.2 这种 753B 模型需要 753 GB 到 1.5 TB 的 host-resident expert 权重远超 512 GB 的物理内存上限根本不能跑。第三种是 KTransformers 这种稀疏激活专家库对小模型做得不错但碰到 GLM-5.2 的 NVFP4 量化布局CPU kernel 直接读不动。FreeToken 团队的判断很清晰所有这些方案的共同短板是把「GPU 太小装不下」当成了一个静态约束再想办法绕过他们的方案则把整台机器看作一个「弹性推理平台」让模型按运行时实际资源自己伸缩。设计核心把执行阶段、缓存、内存管理拆开再合上FreeToken 的工程实现由两个执行原则加一条弹性资源管理策略组成三个机制彼此独立又互相咬合。第一个原则是「带宽自适应执行」。Prefill 阶段用双缓冲GPU 在算当前层的 experts 时下一层的 experts 已经从 host 内存通过 PCIe streaming 过来了算完一步就把下一层的塞进显存。Decode 阶段细粒度更高因为 PCIe 传输和 CPU 直接算 expert 这两件事会争同一份 host 内存带宽。FreeToken 给出了一个叫 q* 的调度策略每一步根据机器实测的两条带宽数字PCIe 带宽和 host 内存带宽把 cache miss 在「GPU cache fill」和「CPU 直接算」之间分配匹配机器实际能跑得动的状态。第二个原则是「语义感知缓存」。LLM Agent 在多轮里会反复编辑上下文比如删掉一段 thinking、加一段 tool call、回头改 prompt 的某一行。FreeToken 抓住这些「语义边界」做检查点——prefill 阶段把 recurrent state 锚在这些边界上一旦 agent 改了 prompt只需要重新算新加的那一段之前的检查点不动。Decode 阶段更细一层相邻 token 经常会路由到重叠的 expertFreeToken 用一个全局 LRU 缓存把这种局部性吃满绝大多数 routed access 在 VRAM 里就命中了只剩下极少数 miss 走 q* 调度。第三个机制是「弹性 GPU expert 内存生命周期」。传统做法在启动时就把 GPU expert 缓存大小定死模型能跑多远从那一刻就锁死了。FreeToken 把这一步做成运行时动态可调在 scheduler 安全点引擎会根据当前剩余显存自动 resize 和重建 GPU expert 缓存整个过程不需要重启引擎、不需要重新加载 host-resident expert 池启动延迟也通过「提前把 expert 加载到最终 host 布局」压了下来。实测六款消费级硬件全面跑赢最强 baseline论文在五款消费级机器上加一款工作站卡上做了 W2 评测W2 是 FreeToken 提的一个端到端吞吐量指标对照对象包括 llama.cpp 这个事实标准的本地推理框架。对照设计很关键所有数字都是同等权重、同等量化格式下测的。硬件内存FreeToken 相对最强 baseline备注RTX 3090 桌面24GB1.3×baseline llama.cppRTX 4090 桌面24GB1.3×baseline llama.cppRTX 5090 服务器主机32GB1.9×服务器级多通道内存RTX 5090 消费级桌面32GB2.1×双通道 DDR5与上一行同样 GPU 硅RTX 4060 笔记本8GB PCIe×81.8×39.3 tok/sNVFP4 量化达到 RTX 4090 的 92% 速度RTX PRO 6000 单卡工作站48GB2.0×14.9 tok/sGLM-5.2 753Bllama.cpp 7.3 tok/sTTFT 7.5s vs 7.8s几个数字值得拎出来讲。第一RTX 4060 笔记本只靠 8GB 显存、PCIe ×8 这种「入门级配置」用 NVFP4 量化版本跑到了 39.3 tok/s相当于 RTX 4090 的 92% 速度。换句话说只要推理框架选对一台普通游戏笔记本就能享受到旗舰消费卡的九成体验。第二5090 服务器主机和 5090 消费级桌面用的是同一块 GPU 硅唯一区别是 host 内存通道数多通道 vs 双通道 DDR5。FreeToken 切到消费级桌面只掉 4% 速度llama.cpp 则掉了 20%——这就是「把 host 内存当一等公民来调度」和「只把 host 内存当 offload 缓冲」的差距。第三RTX PRO 6000 单卡跑 GLM-5.2 这种 753B 的 frontier 级 MoEFreeToken 跑出 14.9 tok/sllama.cpp 只有 7.3 tok/s2.0 倍首 token 时延TTFTFreeToken 是 7.5 秒llama.cpp 是 7.8 秒几乎相同。KTransformers 在同一台机器上根本无法 serve 这个模型——它的 expert 加载策略需要 753 GB 到 1.5 TB 的 host-resident 权重而 512 GB 物理内存根本不够它的 CPU kernel 也读不了 NVFP4 的 layout。换句话说过去想本地跑 GLM-5.2 这件事在 FreeToken 出现之前根本不存在工程解。DeepSeek-V4-Flash 与生态闭环把 frontier 拉回本地这件事做到了FreeToken 的代码已经覆盖 20 多个 MoE 模型对外提供 OpenAI 兼容的 API 接口意味着 Codex、Claude Code、OpenCode、OpenClaw、DeepSeek Harness 这类真实编码 agent 可以直接接上。DeepSeek-V4-Flash 是 README 里点名支持的模型之一——一款典型的稀疏激活 MoE总参数比激活参数大很多正好是 FreeToken 弹性调度最能发挥的场景。更深一层的变化在生态。过去 frontier 模型意味着「必须订阅 OpenAI/Anthropic/DeepSeek 的 API本地只能跑得起 7B/13B/70B」现在 FreeToken 把 35B 笔记本、284B 消费级桌面、753B 工作站单卡这条曲线打通了对应的能力覆盖到了从日常编码助手到本地深度研究的整条需求。配合 Anthropic / OpenAI 兼容 API原有的 agent 框架基本不需要改代码就能切换到 FreeToken 后端。局限不是「AI PC 革命」的全部答案论文自己点出了几条边界。第一FreeToken 性能依赖 NVFP4 / MXFP4 / FP8 这类低精度格式对权重精度敏感的应用比如某些需要精确数值的科研推理不一定适合。第二host-resident expert 池仍然占物理内存跑 753B 这种超大模型还是要 512 GB 量级的 host RAM普通家用机器还是只能玩到 35B / 70B 这一档。第三KTransformers 那条对部分科学计算和长上下文推理做了大量专门优化的路线FreeToken 并没有覆盖对这些场景两者是互补而非替代。另外要注意论文给出的所有数字都在 NVIDIA RTX 30/40/50 系列上测得对 AMD GPU 的支持没有公开数据本地想用 AMD 显卡跑 FreeToken 还需要等社区后续 PR。为什么这篇值得现在就读对 AI 爱好者来说FreeToken 是一份「本地可以放心跑 frontier 模型」的可行性证明——8GB 显存的笔记本都能跑到 RTX 4090 的九成速度这意味着普通游戏 PC / Mac Studio 这类设备的本地推理体验会被一次性抬高几个台阶。对研究者来说论文里关于「PCIe 带宽 vs host 内存带宽双约束下的最优分配」是 MoE 推理调度的一篇高质量工程参考尤其是 q* 策略那段把缓存置换和 CPU offloading 统一到了一个优化框架里值得细读 §3.2。对工业团队来说flashml.ai 已经放出 FreeToken 的桌面 GUI 和 CLI支持 Windows 和 Linux安装只需要一句uv pip install freetoken[accel]对落地私有化部署而言是一条低成本路线。

相关新闻

2026/8/25 1:24:18

Windows C盘清理指南:安全释放30G空间与长效维护策略

1. 先搞清楚“清理30G”到底清的是什么,以及为什么你的C盘总是不够用很多人一看到C盘飘红,第一反应就是找各种“神器”来清理。但清理工具用了一堆,空间释放了没几天又满了,甚至系统还出现了各种奇怪的问题。这通常是因为没搞清楚…

2026/8/25 1:24:18

利用CodeGraph优化大模型代码分析:降低Token消耗的工程实践

在大型语言模型应用开发中,如何高效、精准地控制和管理 Token 消耗,是每个开发者都会面临的成本与性能挑战。尤其是在进行代码分析、文档生成等需要处理大量上下文的任务时,Token 的消耗速度往往超出预期,直接影响到项目的经济成本…

2026/8/25 1:24:18

Mread:终端命令行工具,免费阅读Medium付费墙文章

你是否曾遇到过想阅读一篇 Medium 上的优质技术文章,却因为付费墙而不得不放弃?或者,作为一名开发者,你更习惯在终端(Terminal)里高效地处理一切,包括阅读?今天,我们就来…

2026/8/25 3:29:24

力扣908题最小差值I:数学思维与极值调整的Python高效解法

在算法刷题的过程中,我们常常会遇到一类看似简单,实则暗藏数学巧思的题目。力扣(LeetCode)第908题「最小差值 I」就是其中的典型代表。很多同学初次看到题目描述时,可能会觉得一头雾水,或者尝试用复杂的排序…

2026/8/25 3:29:24

基于SpringBoot的校园食堂就餐推荐系统(程序+文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/25 3:29:24

大模型工具调用全解析:从原理到安全实践,构建智能助手核心能力

1. 先搞清楚“工具调用”到底在解决什么问题如果你正在接触大模型应用开发,尤其是想让它帮你查天气、订机票、发邮件,或者连接数据库、调用外部API,那你一定会遇到“工具调用”这个概念。很多人一上来就去看代码,结果被各种框架、…

2026/8/25 3:29:24

数据末日求生指南:备份恢复终极检查清单,帮助企业防患于未然

数据备份与恢复流程对于业务连续性至关重要。每个企业或个人都需要一个计划和程序来备份、保护和恢复其数据。本文提供了一个简单的检查清单,可作为模板,确保用户的文件和数据永不丢失。备份中应包含哪些文件任何备份计划中首要且可以说最重要的部分&…

2026/8/25 3:29:24

Hadoop+Spark+Hive构建智能招聘系统实战

1. 项目背景与核心价值解析在当今数据驱动的招聘市场中,企业HR和求职者都面临着"数据过载,信息不足"的困境。根据我参与过的三个企业级招聘系统改造项目的经验,传统关系型数据库在处理千万级岗位数据时,查询延迟经常超过…

2026/8/25 3:24:24

充电SAAS系统年费及小程序租售价格是怎样的

新能源充电站运营中,充电管理系统是核心工具,但许多运营商常被“SAAS系统年费多少”“小程序租售价格是否透明”等问题困扰。潍坊骏驰天下能源发展有限公司自主研发的鸢都充电程序,以“价格清晰、模式灵活”为特点,为运营商提供高…

2026/8/25 1:04:19

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 1:12:32

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 8:17:29

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 0:04:14

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory Meta Description:GetQzonehistory 是一个QQ空间历史说…

2026/8/25 0:04:14

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

【题目来源】 https://www.luogu.com.cn/problem/P7912 【题目描述】 小熊的水果店里摆放着一排 n 个水果。每个水果只可能是苹果或桔子,从左到右依次用正整数 1,2,…,n 编号。连续排在一起的同一种水果称为一个“块”。小熊要把这一排水果挑到若干个果篮里&#x…

2026/8/24 13:42:17

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/24 18:13:48

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/25 1:08:14

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…