发布时间:2026/8/24 10:00:33
LiteLLM 缓存配置指南:4 类后端怎么选,重复请求的账单能省多少 LiteLLM 缓存配置指南4 类后端怎么选重复请求的账单能省多少【免费下载链接】litellmThe fastest, litest AI Gateway. Rust core with Python SDK. Call 100 LLM APIs in OpenAI (or native) format with cost tracking, guardrails, load balancing, and logging [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]项目地址: https://gitcode.com/GitHub_Trending/li/litellmLiteLLM 是统一调用 100 LLM API 的网关其缓存机制在请求发往模型前先查历史结果命中直接返回未命中再调用并写入。本文沿一条重复请求的路径讲命中逻辑、后端选型、TTL 与阈值调参以及上线后怎么算账。请求进来先查哪里命中与未命中的判定缓存不是“存了再说”。每次completion()调用LiteLLM 缓存会先构造一个缓存键键由模型名、请求参数temperature、max_tokens 等与消息内容共同决定任一参数不同即视为不同请求键做 SHA256 哈希后拼接命名空间前缀多业务共用同一后端时互不污染查不到才真正调用上游模型响应回来后再写回缓存。缓存默认开启也可设为default_off改为默认不缓存、由请求显式声明开启单次调用想跳过传cache{no-cache: True}即可。各后端的实现集中在源码目录litellm/caching/下排查问题可以按文件名直接定位到对应存储。️ 三步启用 Redis 缓存初始化、命名空间与 TTL单进程开发用typelocal的内存缓存即可多实例部署必须上 Redis否则每个进程的缓存各自为政命中率会明显偏低。import litellm from litellm import Cache litellm.cache Cache( typeredis, hostlocalhost, port6379, namespacemy-project, # 不同命名空间的键互不共享 default_in_redis_ttl86400, # 默认 1 天过期秒 )三步要点初始化一行Cache()挂到litellm.cache全进程生效命名空间按项目或租户划分键空间后续做隔离与清理不用动数据TTL全局默认值用default_in_redis_ttlRedis或default_in_memory_ttl内存单个键的过期时间可在请求级覆盖。对象存储也能当缓存types3配桶名与 regionAzure Blob、GCS 同理适合要和现有存储对齐权限与合规体系的场景代价是对象存储延迟高于 Redis高频热数据不建议放这里。语义缓存阈值如何取值精确匹配要求消息一字不差而 LiteLLM 语义缓存会把消息向量化后做相似度检索措辞不同也能命中litellm.cache Cache( typeredis-semantic, hostlocalhost, port6379, similarity_threshold0.95, # 余弦相似度低于该值视为未命中 redis_semantic_cache_embedding_modeltext-embedding-3-small, )similarity_threshold是这套机制里最敏感的参数取高0.97 以上只命中几乎同义的请求安全但收益小取低0.9 以下“怎么退订”和“怎么退款”可能互相命中返回错误答案建议从 0.95 起步拿真实流量看一周命中样本误命中多就上调命中率上不去且请求高度重复再下调。语义缓存每次请求多一次 embedding 调用请求量低或对延迟敏感时精确匹配反而更划算。caching_groups 跨模型复用与请求级动态控制两个进阶能力都作用在“缓存键怎么算”上caching_groups在metadata里传caching_groups[[gpt-4o, claude-3-5-sonnet]]同组模型共用一个缓存键。主模型限流切到备用模型时能直接复用结果也方便在切换模型时做 LLM API 降本对比请求级覆盖completion()的cache参数可对单次调用指定过期时间与空间如cache{s-maxage: 3600, namespace: user_123}表示这条结果只缓存一小时且归属独立用户空间。这套粒度适合“大部分请求走默认缓存、个别实时接口例外”的系统不用为少数请求牺牲全局配置。 上线后如何核算命中率、成本与响应时间缓存值不值看四个数指标含义获取位置命中率直接由缓存返回的请求占比代理访问日志成本节省命中次数 × 单次调用均价代理成本统计响应时间命中 / 未命中两组 P50、P95 对比APM 或日志存储占用Redis 内存或对象存储用量后端自身监控接入日志后端后可逐条看到每次调用的耗时与花费把命中流量和真实上游流量分开统计。做缓存命中率优化的一般经验低于 20% 先查键是否因参数漂移频繁变化例如请求里带了时间戳高于 60% 则可以考虑放宽 TTL进一步压上游调用量。聊天机器人与批量请求的落地方式聊天机器人FAQ 复用率最高用命名空间分“全局知识 / 会话级”两层全局问答共用缓存带个人上下文的消息单独空间或不缓存批量请求离线任务先对输入去重同批任务统一命名空间、跑完整批失效批量中间结果挂no-cache避免污染线上缓存。四个落地注意事项先用小流量命名空间灰度观察命中率与误命中再全量放开TTL 跟着数据时效走知识类按周行情新闻类按分钟甚至不缓存语义缓存阈值上线后要抽检命中样本不能只看命中率数字给命名空间级 TTL 兜底定期清理长尾键防止存储无限增长。把上面的 Redis 配置和命名空间策略套到现有部署上先跑一周命中率与成本数据再回填 TTL 与阈值的具体数值是最省心的起步路径。【免费下载链接】litellmThe fastest, litest AI Gateway. Rust core with Python SDK. Call 100 LLM APIs in OpenAI (or native) format with cost tracking, guardrails, load balancing, and logging [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]项目地址: https://gitcode.com/GitHub_Trending/li/litellm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/24 9:55:31

SAP第二代增强:从函数模块到可配置架构的演进与实践

1. 项目缘起:从“打补丁”到“搭积木”的演进在ERP这类大型企业应用软件的定制化开发中,我们经常会遇到一个经典难题:标准功能无法完全满足某个特定客户的独特业务流程。十多年前,当我第一次接触SAP系统时,面对这种需求…

2026/8/24 12:21:09

基于DeepSeek Harness构建Obsidian智能助手:私有知识库的AI Agent实践

1. 这篇文章真正要解决的问题如果你是一个重度使用 Obsidian 的知识工作者或开发者,你是否曾有过这样的体验:面对一个凌乱的笔记库,想快速找到某个概念的定义,却需要手动翻阅多个笔记;或者,你想基于已有的笔…

2026/8/24 12:21:09

中小团队后端技术栈搭配方案:稳定、高效、可维护

“这个项目用Go重写吧,性能好。”——说这话的人不用维护旧系统。“用Spring Cloud吧,业界标准。”——说这话的人不用负责月底对账。“上K8s吧,以后扩展方便。”——说这话的人忘了你们团队只有六个后端。 中小团队的技术栈选择&#xff0c…

2026/8/24 12:21:09

SenseNova U1.5 Lite:轻量级多模态模型从入门到部署实战

最近在尝试将多模态能力集成到移动端或资源受限的边缘设备时,常常遇到模型体积庞大、推理速度慢、部署成本高的难题。商汤科技最新开源的 SenseNova U1.5 Lite 模型,恰好为这个痛点提供了一个高效的解决方案。本文将带你从零开始,全面解析这个…

2026/8/24 12:21:09

大语言模型上下文压缩技术:原理、应用场景与工程实践指南

上周,我花了一下午时间,试图复现一个关于“上下文压缩”的“神奇”效果。起因是看到一些讨论,说最新的模型在处理超长文本时,通过某种压缩技术,能在保持性能的同时,大幅降低计算成本。听起来像是解决“上下…

2026/8/24 12:21:09

体制内文档自动化:基于本地部署的模板化生成与LLM润色实践

这次我们来看一个体制内工作者为了应对日常材料撰写需求而开发的自动化系统。这个项目的核心不是追求前沿的AI模型,而是聚焦于解决一个非常具体的痛点:如何利用现有的、可本地部署的技术栈,将繁琐、重复的文字材料工作自动化,从而…

2026/8/24 12:16:09

向量化分析引擎与 AI 辅助存储排障:版本更新后先测什么

向量化分析引擎与 AI 辅助存储排障:版本更新后先测什么 向量化引擎升级后,不能只在一类 CPU 上看吞吐。不同代际的处理器对 AVX 指令、频率和内存带宽的反应不同;同一版 AI 排障 Agent 也可能因为指标字段变化而误判。因此需要把硬件兼容、算…

2026/8/24 0:07:22

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 1:12:32

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 8:17:29

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/24 1:09:25

3条命令跑通LocalAI:无GPU本地AI引擎部署

3条命令跑通LocalAI:无GPU本地AI引擎部署 【免费下载链接】LocalAI LocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required. 项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI…

2026/8/24 1:09:25

AI推理性能测试怎么做:MLPerf Inference完整上手指南

AI推理性能测试怎么做:MLPerf Inference完整上手指南 【免费下载链接】inference Reference implementations of MLPerf inference benchmarks 项目地址: https://gitcode.com/gh_mirrors/inf/inference 同一个模型换一张卡,速度快多少你知道吗&a…

2026/8/23 13:29:45

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/23 6:14:43

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/23 4:22:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…