发布时间:2026/8/30 16:45:15
LLM agent 的 5 种上下文压缩策略 LLM agent 的 5 种上下文压缩策略把 agent 的上下文压缩之后token 数可能降了账单反而更高。原因不在 token 数本身而在 prefix caching 里token 数和最终计费额本来就是两回事。一个长时间运行的 agent session每次调用都会把整段历史重新发一遍只是在 transcript 末尾再追加模型回复和工具输出。之所以还能负担得起是因为每次请求前面的那一大段字节都和上一轮完全一样。provider 会把这段内容按 cache read 计费。在 Anthropic 这里这部分价格是 base input 的 10%所以只要上下文一直只在尾部增长不管历史有多长成本都还算可控。compaction 改的不是 transcript 的尾巴而是前面那一段。harness 会把原来的对话轮次换成摘要所以从这次修改开始后面的内容就都和之前缓存过的版本对不上了。假设一个 session 已经积累了 100K tokens 的历史。正常情况下下一次调用会把这段历史按 cache read 读取价格相当于按原价计 10K tokens。但如果你把它压成一个 10K 的摘要之前可命中的内容就没有了这 10K 会按 1.25x base input 记成 cache write也就是 12.5K。上下文缩小了 10 倍调用反而更贵。后面多跑几轮这部分额外成本确实能慢慢摊回来。但 harness 往往是碰到 token 阈值就触发 compaction长 session 会反复压缩每压一次都会把这条缓存边界重新洗掉。这并不是说 compaction 做错了。context window 本来就是有限的工程上常见的做法主要有 5 种。Truncation 会在快碰到上限时直接丢掉最老的 tokens。它实现成本最低也是唯一一种会永久丢失早期决策的方法。Rolling summarization 会把每次新摘要并进一个持续存在的状态里而不是每次从头重写但它依然会在每次更新时移动缓存边界。Prompt compression 会用一个小模型给每个 token 打分再把相关性低的 token 丢掉。LLMLingua 报告说最多可以做到 20x 压缩同时只带来很小的精度损失LLMLingua-2 则用一个 BERT 大小的 encoder 来完成同样的打分。RAG-based retrieval 会把历史移进 vector DB只把和当前 query 匹配的内容再注回 prompt所以真正的风险点会变成 retrieval precision。前 3 种做法都是直接删文本RAG 则是把文本移进一个外部存储里只有 retrieval 真把它取回来时agent 才会再次看到它。KV cache eviction 发生在 serving layer。它丢掉的是最不可能再被用到的条目判断方式可能看 attention score比如 H2O 和 SnapKV也可能看位置比如 StreamingLLM。完整历史还是会照常送进模型。真正被丢掉的是 GPU 为这些 tokens 算出来的 KV tensors。既然这些 tensor 本来就是从 tokens 推出来的eviction 的代价就更接近 prefill work而不是信息本身。这些内容随时都能重新计算。如果某些 KV blocks 放不进 GPU memory它们还可以转到 CPU DRAM、本地 NVMe 或远端存储里下次请求再加载回来而不是重新走一遍 prefill。LMCache 把这件事做成了一个给 vLLM、SGLang 和 Dynamo 用的开源层。通过 CacheBlend它不仅能复用 prompt 开头那段缓存块也能复用 prompt 任意位置上的缓存块。Repohttps://github.com/LMCache/LMCache更多知识学习尽在 https://www.dailydoseofds.com/部署工具推荐Zeabur少折腾服务器把时间留给产品前端全栈、小程序后台还是OpenClaw、Claude Code这类 AI 应用它都能让你跳过配置服务器的琐事push 完代码就上线。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

2026/8/30 16:45:15

FreeRTOS架构深度拆解:从任务调度到内存管理

在实际嵌入式项目中,FreeRTOS 早已不只是“引入几个 .c 文件、创建几个任务”那么简单。很多开发者在 CubeMX 里勾选 FreeRTOS 后能顺利点亮 LED、跑通串口,但一旦遇到任务不切换、堆栈溢出、优先级反转、低功耗唤醒异常这类问题时,就会陷入“…

2026/8/30 16:40:05

樱花动漫反爬实战:chameleon.js动态token与环境指纹破解

先交代下背景。做了五年逆向,从早期 PC 端 flash 播放器的解密,到后来主流视频站点的 m3u8 解析,再到各种魔改协议的还原,说实话,我已经很久没有遇到能让我卡住超过两天的反爬了。直到这次接到樱花动漫的采集需求&…

2026/8/30 16:40:05

图片转矢量图 算法总结

pixels2svg 比较慢,但是成功了;from pixels2svg import pixels2svg # 直接将 PNG 转换成 SVG pixels2svg(/data/lbg/project/hunyuan3d/Hunyuan3D-Part/data/wenzi/1690112.png, output.svg,color_tolerance64) vtracervectorizer.ai方案原理地图适用性缺…

2026/8/30 17:00:17

大模型低成本接入实战:GLM-5.3-Flash API调用与排错全攻略

很多开发者第一次接触 GLM-5.3-Flash,通常是因为一个很现实的场景:业务并发上来了,模型 API 账单开始以肉眼可见的速度增长。团队既要保效果,又不得不压缩成本。过去大家习惯用旗舰大模型兜底所有需求,但真正的线上服务…

2026/8/30 17:00:17

DeepSeek-V4-Pro开发实战:从API接入到本地部署

最近有不少读者在配置 DeepSeek 模型时,遇到各种版本命名、API 接入、本地部署和开发工具联动的问题。其中“DeepSeek-V4-Pro”这个名字在社区里传得比较广,但网上资料又比较零散,很多教程停留在“能跑通”层面,缺少对参数、错误处…

2026/8/30 17:00:17

AI插件标准与MCP:从统一接入到工程实践

先说一个很多开发者最近都会遇到的场景:电脑里装了好几个 AI 编程工具,一会儿要在编辑器里装个插件,一会儿要开一个命令行工具处理仓库级任务,一会儿又要接一个外部知识库。每个工具都能干点事,但它们的配置方式、上下…

2026/8/30 17:00:17

Java List源码与面试实战:从ArrayList底层到排序与线程安全

很多年前我面大厂的时候,遇到一个场景题:线上有个接口频繁 Full GC,排查下来是某个高频查询里用 List.contains 做了大批量判断,而那个 List 是 LinkedList 。当时我第一反应是“用 HashSet 替换啊”,但面试官紧…

2026/8/30 17:00:16

2026论文写作AI红黑榜:从开题到答辩避坑指南

写论文这件事,最怕的不是写不出来,而是写出来了却过不了查重和AI检测。从开题时的选题纠结,到答辩前的PPT焦虑,每个环节都在消耗精力。这篇红黑榜把从开题到答辩会用到的AI工具梳理一遍,红榜放心选,黑榜绕着…

2026/8/30 16:55:16

写小说卡文?不是灵感问题,而是叙事结构失去了推进力

写小说写到一半卡住,最难受的不是“不知道接下来写什么”,而是你很清楚后面还有一大段情节要写,但就是下不去笔。翻翻之前写的内容,觉得不对劲,又说不上来哪里不对。硬写五百字,回头看全想删。 很多写作者…

2026/8/30 0:03:35

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/8/30 0:03:35

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/8/30 0:03:35

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/8/30 0:03:35

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/8/30 0:03:35

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/8/30 0:03:35

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…