发布时间:2026/8/18 19:19:44
AI Agent从无到有45: LangChain 嵌入模型实战 — 从文本到向量 纲要嵌入模型的核心作用将非结构化文本转化为高维向量坐标支撑语义相似度检索是 RAG 系统的基石LangChain 嵌入模型接口统一封装embed_documents与embed_query主流模型接入OpenAI、Ollama、BGE、智谱等嵌入缓存机制原理避免重复向量化降低 API 调用成本实现CacheBackedEmbeddings 本地文件存储国产嵌入模型集成以硅基流动平台的 BGE‑M3 为例配置代理地址与 API Key无缝切换完整可运行代码使用FakeEmbeddings演示嵌入、缓存与检索无需外部 API Key引言在 RAG 流水线中文档经过加载和切片之后必须被转换成一种机器可以理解的数学形式——向量。嵌入模型就是将文本映射为高维空间中的坐标使得语义相近的文本在空间中彼此靠近。LangChain 为这些模型提供了统一的调用方式并内置缓存来优化重复嵌入的性能与成本。本文将通过可运行的代码展示如何在 LangChain 中使用嵌入模型并接入国产模型。适用版本说明本文示例基于langchain-core0.1.x及langchain-community0.1.x。CacheBackedEmbeddings在langchain0.1.0中已稳定支持。嵌入模型的工作原理嵌入模型本质上是一个“翻译器”输入一句话如“今天天气怎么样”输出一个固定长度的数字数组向量。语义相近的句子生成的向量距离更近反之则更远。在 RAG 系统中嵌入模型承担两项任务入库将知识库中的文档片段逐一向量化存入向量数据库。检索将用户查询向量化在数据库中搜索距离最近的 Top‑K 个片段。文档 / 用户查询嵌入模型高维向量向量数据库存储 / 相似性搜索LangChain 中的嵌入模型实现所有嵌入模型都实现两个核心方法embed_documents(texts: List[str])批量嵌入文档。embed_query(text: str)嵌入单个查询。常用嵌入模型一览模型维度语言支持运行方式OpenAItext-embedding-ada-0021536多语言API 调用BGE‑M3BAAI1024多语言本地 / API智谱嵌入模型1024中文API 调用Ollama 托管的开源模型可配置取决于模型本地运行选型注意事项入库和检索必须使用同一个嵌入模型且向量数据库的维度需与模型一致。中文应用优先选择专门优化中文的模型混合语言场景则用多语言模型。非本地运行的嵌入模型按 token 计费合理使用缓存可大幅降低成本。缓存机制同一段文本通过同一嵌入模型得到的向量始终不变。LangChain 提供了CacheBackedEmbeddings可将向量缓存到本地文件或 Redis再次嵌入时直接读取避免重复计算。完整可运行代码以下代码使用FakeEmbeddings模拟嵌入过程并演示缓存的效果。无需任何 API Key可直接在本地运行。安装依赖pipinstalllangchain langchain-core langchain-community chromadb核心代码fromlangchain_community.embeddings.fakeimportFakeEmbeddingsfromlangchain_community.vectorstoresimportChromafromlangchain_core.documentsimportDocumentfromlangchain.embeddingsimportCacheBackedEmbeddingsfromlangchain.storageimportLocalFileStoreimporttime# 1. 准备文档docs[Document(page_content智能温控水杯支持手机 App 远程控温。),Document(page_content产品续航 48 小时采用 316 不锈钢内胆。),Document(page_content充电时请使用 5V/2A 适配器。),]base_embeddingsFakeEmbeddings(size128)# 2. 无缓存嵌入starttime.time()vectorstore_no_cacheChroma.from_documents(docs,base_embeddings,collection_nameno_cache)print(f无缓存嵌入耗时{time.time()-start:.4f}秒)# 3. 带缓存嵌入storeLocalFileStore(./embedding_cache/)cached_embeddingsCacheBackedEmbeddings.from_bytes_store(base_embeddings,store,namespacetest)starttime.time()vectorstore_cachedChroma.from_documents(docs,cached_embeddings,collection_namecached)print(f首次嵌入填充缓存耗时{time.time()-start:.4f}秒)# 4. 再次嵌入相同文档命中缓存starttime.time()vectorstore_cached2Chroma.from_documents(docs,cached_embeddings,collection_namecached2)print(f再次嵌入命中缓存耗时{time.time()-start:.4f}秒)# 5. 检索测试query如何给水杯充电vectorstoreChroma.from_documents(docs,cached_embeddings)resultvectorstore.similarity_search(query,k1)print(f检索结果{result[0].page_content})运行后可以观察到第二次嵌入的耗时显著减少验证了缓存机制的效果。注意CacheBackedEmbeddings.from_bytes_store在langchain0.1.0中可用。若使用更早版本请参考官方文档的迁移指南。国产嵌入模型集成示例以硅基流动平台的 BGE‑M3 为例它完全兼容 OpenAI 的 API 格式只需修改模型名、API Key 和 Base URL 即可接入。fromlangchain_openaiimportOpenAIEmbeddings embeddingsOpenAIEmbeddings(modelBAAI/bge-m3,openai_api_keyyour_api_key,# 替换为实际 Keyopenai_api_basehttps://api.siliconflow.cn/v1# 平台代理地址)vectorsembeddings.embed_documents([智能温控水杯,明天天气])print(f向量维度{len(vectors[0])})# 输出 1024版本兼容提示langchain-openai包在v0.1.0之后支持openai_api_base参数。若使用langchain0.3.0推荐使用base_url替代openai_api_base两者在过渡期均有效。API 速览本节汇总博客中涉及的核心 APIAPI所属库方法签名说明FakeEmbeddingslangchain_community.embeddings.fake__init__(size: int)生成指定维度的随机向量用于测试CacheBackedEmbeddingslangchain.embeddingsfrom_bytes_store(underlying_embeddings, document_embedding_store, namespace)包装嵌入模型提供缓存能力LocalFileStorelangchain.storage__init__(root_path: str)本地文件系统存储用于缓存持久化Chromalangchain_community.vectorstoresfrom_documents(documents, embedding, collection_name)从文档列表创建向量数据库OpenAIEmbeddingslangchain_openai__init__(model, openai_api_key, openai_api_base)调用 OpenAI 兼容接口的嵌入模型Demo 示例以下是一个完整的、可直接运行的 HTML 文件使用 Python 后端演示了嵌入、缓存与检索的完整流程。运行说明将上述核心代码保存为embedding_demo.py。在终端执行python embedding_demo.py。观察控制台输出的耗时对比和检索结果。代码说明使用FakeEmbeddings模拟嵌入无需真实 API Key。通过CacheBackedEmbeddings实现缓存第二次嵌入耗时明显降低。使用Chroma向量数据库进行相似性检索验证嵌入质量。技术点总结LangChain 统一的嵌入接口设计。缓存机制的原理与实现方式。向量数据库的创建与检索流程。参考文档官方文档LangChain Embeddings 概念文档LangChain CacheBackedEmbeddings API 参考LangChain Chroma 向量存储文档OpenAI Embeddings API 参考参考链接硅基流动平台 API 文档BGE‑M3 模型页面 (HuggingFace)Ollama 嵌入模型支持总结嵌入模型是连接文本与向量计算的桥梁也是 RAG 检索质量的决定性因素之一。LangChain 通过embed_documents和embed_query两个方法统一了调用接口配合缓存机制可有效控制成本。无论是使用 OpenAI 还是国产 BGE 系列掌握好嵌入模型的选型和接入方式就能为 RAG 应用打下坚实基础。

相关新闻

2026/8/18 19:14:44

【2014-04-10】quitting can be productive sometimes

[历史归档] 本文原发布于 cstriker1407.info 个人博客,内容为历史存档,仅供参考。 发布时间: 2014-04-10 | 标题:quitting can be productive sometimes | 分类: 生活点滴 / 英语学习 &…

2026/8/18 19:14:44

sys.path 与 os.getcwd区分:代码运行中的路径问题

获取当前工作目录 import sysprint(sys.path[0])获取执行命令的位置 import osprint(os.getcwd())python 代码运行路径问题 在下载使用别人的代码进行运行时,有时会遇到路径问题。将自己目前遇到的进行分类和总结。 主要分为两类: import相关open文件相关…

2026/8/18 19:14:44

@EnableRetry注解解读

<dependency><groupId>org.springframework.retry</groupId><artifactId>spring-retry</artifactId></dependency> 前言 在分布式系统、微服务架构以及对外部服务&#xff08;如数据库、第三方API、消息队列&#xff09;的调用中&#xf…

2026/8/18 20:25:19

AtCoder Beginner Contest 181-200

AtCoder Beginner Contest 181 AtCoder Beginner Contest 181-CSDN博客 AtCoder Beginner Contest 182 AtCoder Beginner Contest 182_[abc182d] wandering-CSDN博客 AtCoder Beginner Contest 183 AtCoder Beginner Contest 183_atcoder183题解-CSDN博客 AtCoder Beginner Con…

2026/8/18 20:25:19

计算周期优化:从原理到工业与金融实践

1. 项目概述&#xff1a;什么是"计算周期1"&#xff1f; "计算周期1"这个看似简单的概念&#xff0c;实际上在数据处理、自动化控制、金融分析等多个领域都有广泛应用。简单来说&#xff0c;它指的是一个完整计算过程从开始到结束的时间跨度。这个周期可能…

2026/8/18 20:25:19

基于Hadoop+Spark的高血压风险分析系统设计与实现

1. 项目背景与核心价值 高血压风险分析系统是一个典型的医疗健康领域大数据应用。根据世界卫生组织统计&#xff0c;全球约有12.8亿成年人患有高血压&#xff0c;其中近半数人并不知晓自己患病。这种"沉默的杀手"每年导致约1000万人死亡&#xff0c;而早期风险预测可…

2026/8/18 20:25:19

STM32F051定时器硬件刹车功能:从原理到实战的电机安全保护指南

1. 从一次电机失控说起&#xff1a;为什么刹车功能不是“可有可无”的配置那天下午&#xff0c;实验室里弥漫着一股淡淡的焦糊味。一块STM32F051的开发板连着一个小型直流有刷电机&#xff0c;原本平稳运行的PWM调速程序&#xff0c;在某个瞬间突然失控&#xff0c;电机轴像脱缰…

2026/8/18 20:25:19

协同进化LLM智能体系统:攻克长视野复杂任务的架构与实战

1. 项目概述&#xff1a;当大语言模型学会“进化”与“协作” 最近在琢磨长周期、多步骤的复杂任务自动化时&#xff0c;发现一个挺有意思的瓶颈&#xff1a;单个大语言模型&#xff08;LLM&#xff09;Agent&#xff0c;哪怕能力再强&#xff0c;面对一个需要连续决策、调用多…

2026/8/17 10:49:52

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/18 6:58:27

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/18 0:02:05

Qwen3.8-27B本地部署实战:17GB内存运行270亿参数大模型

1. 这篇文章真正要解决的问题 你是否曾对动辄需要上百GB显存才能运行的百亿参数大模型望而却步&#xff1f;是否觉得在个人电脑上部署一个功能强大的语言模型是天方夜谭&#xff1f;最近&#xff0c;通义千问团队发布的 Qwen3.8-27B 模型&#xff0c;宣称仅需 17GB 内存即可在本…

2026/8/18 0:02:05

ME3169 36V,8A,180KHz 恒压Buck DC-DC 转换器

概述ME3169 是一款180KHz&#xff0c;PWM 模式恒压Buck DC-DC 转换器&#xff0c;8V 到36V 宽工作电压范围&#xff0c;低纹波&#xff0c;内置低导通电阻功率MOS。ME3169 内置环路补偿电路&#xff0c;可以减少外围元器件数量。内部设计有恒压环路&#xff0c;可以通过外部电阻…

2026/8/18 18:23:10

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站&#xff0c;核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测&#xff0c;千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队&#xff0c;覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/17 17:27:06

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站&#xff0c;核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测&#xff0c;千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队&#xff0c;覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/18 7:12:40

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具&#xff0c;覆盖选题构思、文献整理、内容生成、格式排版等核心场景&#xff0c;真正帮你高效搞定论文难题。 一、全流程王者&#xff1a;一站式搞定论文全链路&#xff08;一天定稿首…