发布时间:2026/8/19 11:27:23
小白程序员必看:掌握 RAG 中 Embedding 的核心,让你的大模型应用效果翻倍 本文深入浅出地解析了 RAG 技术中 Embedding 的关键作用强调 Embedding 是影响 RAG 效果的关键环节。文章详细阐述了 Embedding 的本质、工作原理、模型选择标准以及如何通过业务数据评估其效果。同时还提供了实用的代码示例帮助读者更好地理解和应用 Embedding 技术。对于想要提升大模型应用效果的程序员来说本文是不可多得的参考资料。面试里问 RAG很多人会把重点放在“向量数据库”和“Prompt 组装”上却把 Embedding 轻轻带过文本转向量嘛调个 API 就行。这其实是一个很危险的误区。RAG 能不能把正确资料找出来第一步就卡在 Embedding。如果问题和文档被映射到错误的语义空间后面的 Rerank、Prompt、LLM 都是在补漏洞。这章用通俗方式讲清楚 5 件事Embedding 到底是什么为什么相似文本会靠近RAG 里它怎么工作模型应该怎么选以及怎样用业务数据评估效果。一、先给一个面试级简答Embedding 是把文本映射成固定长度数字向量的过程。它的核心价值不是“变成数字”而是让语义相近的文本在向量空间里距离更近。在 RAG 里系统会先把知识库 Chunk 转成向量存入向量数据库用户提问时再把 Query 转成向量用相似度检索找到最相关的 Chunk最后把这些 Chunk 作为上下文交给大模型回答。选模型不能只看 MTEB 排行榜也不能盲目相信某一个 API。实际工程里要看语言场景、数据合规、向量维度、最大输入长度、部署成本和业务评测结果。真正有参考价值的是在自己的业务数据上跑 HitK、MRR、nDCG 等指标。二、Embedding 的本质不是数字游戏而是语义坐标Embedding 模型做的事情可以理解成“给文本找一个语义坐标”。一段话、一个标题、一个问句都会被映射成一串浮点数。比如 768 维、1024 维、1536 维本质上都是在高维空间里给文本定位。这串数字单独看没有意义真正有意义的是向量之间的距离。两个文本表达的意思越像它们的向量方向越接近意思越远它们在空间里就越分散。这也是为什么 RAG 能处理“同义不同字”的问题。用户说“iPhone 如何截屏”知识库里写的是“苹果手机怎么截图”关键词可能对不上但语义向量可以把它们拉到同一个区域。三、为什么常用余弦相似度衡量两个向量像不像常见方法有余弦相似度、点积和欧氏距离。RAG 里最常见的是余弦相似度因为它主要看两个向量的方向而不是向量长度。可以把每个向量想成一支箭头。如果两支箭头指向差不多的方向说明两段文本在语义上接近至于箭头长一点还是短一点不是最重要。工程里要特别注意Embedding 模型、向量库和评测脚本必须使用一致的距离函数。如果离线评测用 cosine线上向量库用 L2 或点积排序结果可能会不一致。四、RAG 里的 Embedding 有两条链路第一条是离线建库链路原始文档经过清洗、切块、加元数据后每个 Chunk 都会送入 Embedding 模型得到向量然后和原文、来源、标题、更新时间等信息一起存入向量库。第二条是在线问答链路用户提问后系统会把 Query 转成向量去向量库里找最相似的 Chunk再把这些 Chunk 拼进 Prompt让大模型基于证据回答。所以 Embedding 的质量直接决定“正确资料能不能被召回”。一旦召回错了大模型即使再强也只能在错误资料上发挥。五、Embedding 检索和关键词检索有什么不同关键词检索擅长精确匹配比如合同编号、产品型号、错误码、专有名词。Embedding 检索擅长语义泛化比如同义词、口语化表达、跨语言表达、不同说法的同一个问题。但语义检索不是万能的。它可能把“意思像但事实不对”的内容也召回来而关键词检索虽然死板却能在精确约束上表现稳定。成熟的 RAG 系统一般会采用混合检索关键词召回保证精确性向量召回保证语义泛化再用 Reranker 做最终排序。六、常见 Embedding 模型怎么选Embedding 模型大致可以分为 API 型、本地开源型、多模式型和专域增强型。API 型接入快、维护少适合快速验证本地开源型适合数据敏感、私有化部署的企业场景。如果知识库主要是中文不能只看英文排行榜。中文客服、金融、政务、医疗等场景需要优先在自己的中文业务数据上测 BGE、Qwen3-Embedding 等模型。中英混合或多语言场景可以重点测试 BGE-M3 这类多语言模型。模型维度也不是越高越好。高维向量通常表达能力更强但存储成本、检索延迟、索引构建时间都会提高。百万级以上知识库维度差异会明显影响预算。Embedding 模型选型矩阵。维度、效果和成本之间存在取舍。七、不要只看排行榜要用业务数据评估MTEB 这类通用榜单适合做初筛但不能直接代表你的业务效果。因为你的知识库可能是法律条款、客服 FAQ、医疗病例、代码文档也可能有大量行业缩写和内部黑话。更可靠的方式是准备几百到几千条业务评测样本每条样本包含一个真实用户问题以及它对应的正确答案 Chunk。然后用候选 Embedding 模型分别建库、检索看正确 Chunk 是否出现在 TopK。Hit5 0.80 的意思是100 个问题里有 80 个问题的正确答案出现在检索结果前 5 条。这个指标很直观也很适合和业务方沟通。八、代码示例生成向量并计算相似度下面是一个最小化示例把 query 和文档都转成向量然后用余弦相似度排序。实际项目里需要把文档向量提前存入向量库不会每次现算。from openai import OpenAI import numpy as np client OpenAI() def embed(text: str) - np.ndarray: resp client.embeddings.create(modeltext-embedding-3-small,inputtext,) return np.array(resp.data[0].embedding, dtypenp.float32) def cosine(a: np.ndarray, b: np.ndarray) - float: return float(np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b))) query iPhone 如何截屏 docs [苹果手机截图可以同时按侧边键和音量上键。,苹果汁可以用榨汁机制作。,安卓手机通常可以通过电源键和音量键截图。,] q_vec embed(query) ranked sorted([(doc, cosine(q_vec, embed(doc))) for doc in docs],keylambda x: x[1],reverseTrue,) for doc, score in ranked: print(round(score, 4), doc)如果你使用本地模型代码结构类似只是把 API 调用换成本地推理服务。关键不是代码长短而是要确保文档和 Query 使用同一个模型版本、同一个维度、同一种归一化策略。九、代码示例用 HitK 做业务评测下面这个评测函数可以帮助你判断正确答案是否出现在 TopK 结果里。真实项目中retriever 可以是向量库也可以是混合检索 Rerank。from typing import List, Dict # eval_set 示例 # [ # {query: 如何重置密码, gold_chunk_id: faq_001}, # {query: 发票在哪里下载, gold_chunk_id: faq_102}, # ] def hit_at_k(eval_set: List[Dict], retriever, k: int 5) - float: hit 0 for item in eval_set: query item[query] gold_id item[gold_chunk_id] results retriever.search(query, top_kk) retrieved_ids [r.chunk_id for r in results] if gold_id in retrieved_ids: hit 1 return hit / len(eval_set) score hit_at_k(eval_set, retriever, k5) print(fHit5 {score:.2%})如果候选模型 A 的 Hit5 是 82%模型 B 是 76%但模型 A 延迟是模型 B 的三倍就不能只看准确率。生产选型要把召回质量、延迟、成本、合规一起算。十、生产级 Embedding 服务怎么设计生产环境不要把 Embedding 当成一个简单函数。它应该是一个可观测、可回滚、可灰度的基础服务。文档入库时要记录 embedding_model、dimension、normalize、version、created_at 等元数据。因为一旦模型升级历史向量通常需要重建如果新旧向量混在一个索引里检索结果会变得不可控。在线检索时要关注 P95 延迟、TopK 命中率、空召回率、Rerank 后排名变化、Embedding API 错误率和成本。尤其是大规模知识库Embedding 成本不只在调用 API还在存储、索引、备份和重建。十一、常见坑RAG 效果差往往错在检索地基第一只看排行榜不做业务评测。通用榜单适合初筛但业务分布不同模型效果可能完全不同。第二不区分 Query 和 Document。有些模型建议为查询和文档使用不同的输入提示如果全部按普通文本处理检索效果可能打折。第三换模型不重建索引。不同模型产生的向量空间并不一致把不同模型的向量混在一起检索等于把地图坐标系混用了。第四忽略 Chunking。Embedding 模型再好如果 Chunk 把语义切碎正确答案也很难被召回。第五只有向量检索没有关键词兜底。订单号、错误码、型号、日期、法律条文编号这类信息关键词检索往往更稳定。十二、面试回答模板Embedding 是 RAG 的检索基础它把文本映射成固定长度的语义向量让语义相近的 Query 和 Chunk 在向量空间里靠近。检索时我们把用户问题也转成向量用余弦相似度或点积从向量库里找 TopK 相关 Chunk再交给大模型回答。模型选型上我不会只看排行榜。会先根据语言、合规、维度、最大输入长度和部署成本做初筛再用自己的业务评测集跑 HitK、MRR、nDCG同时关注 P95 延迟和存储成本。中文或私有化场景会重点测 BGE、Qwen3-Embedding 等本地模型快速验证或英文场景可以测试 OpenAI、Voyage、Cohere 等 API 模型。上线后还要做版本管理和监控。每条向量都要记录模型版本和维度模型升级时要重建索引召回效果要持续监控避免知识库更新或用户问题变化后效果漂移。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取

相关新闻

2026/8/19 11:27:23

千问 LeetCode 3966. 统计范围内的好整数 Java实现

LeetCode 3966. 统计范围内的好整数 Java实现题目分析 需要统计区间[l, r]内相邻数位绝对差至多为k的「好整数」数量。由于r最大可达10^15,暴力枚举会超时,因此采用数位DP前缀和的思路: - 定义count(x, k)为[0, x]内的好整数数量,…

2026/8/19 11:27:23

init_top_pgt

NEXT_PGD_PAGE(init_top_pgt) /* L4 --> pgt */.fill 512,8,0.fill PTI_USER_PGD_FILL,8,0 /* 512 */这段代码是 Linux 内核启动时,定义和初始化另一个关键顶层页表 init_top_pgt 的核心部分,它位于 arch/x86/ke…

2026/8/19 11:27:22

一、uni-app项目创建与运行指南(Vue3 )

一、项目创建 1. 创建项目 本节使用 uni-app 官方提供的 Vue3 Vite 模板快速初始化项目,避免手动搭建脚手架。环境准备:Node.js 16.0 及以上版本,推荐使用最新长期支持版本;并提前安装微信开发者工具。在终端执行以下命令创建项目…

2026/8/19 12:42:38

ESP32与Python实战:数据可视化与硬件交互的创意项目

1. 项目缘起:当“飞行”遇上“股市”,一个创意想法的诞生 最近在刷社交媒体和创意社区时,发现一个非常有趣的现象:很多朋友开始把一些看似不相关的概念进行“硬核”组合,创造出极具传播力和趣味性的个人项目。比如&…

2026/8/19 12:37:37

智能体界面设计:从频繁交互到高效解释的沟通范式转变

1. 项目概述:从“交互”到“解释”的界面范式转移 最近在跟进一些前沿的AI应用项目时,我反复被一个核心问题困扰:我们是不是把“智能体”做得太“吵”了?这里的“吵”不是指声音,而是指交互的密度和复杂度。无论是企业…

2026/8/19 4:14:28

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/18 6:58:27

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/19 0:00:35

【单片机课程设计/毕业设计】基于 STM32 与 WiFi 模块的室内通风智能管控系统设计 基于 STM32 的人体存在感知自适应风扇控制系统设计(018503)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/8/19 0:00:35

AI如何驱动数学猜想生成:从大语言模型到自动化数学发现

1. 项目概述:当AI开始“猜”数学定理 最近在AI研究圈里,一个名为“Moonshine”的项目引起了不小的讨论。这名字本身就挺有意思,直译是“月光”,但在数学史上,它特指一个神秘而美丽的联系——魔群月光猜想,连…

2026/8/19 0:00:36

Agentic Web:构建智能体原生网络的基础设施挑战与四大支柱

1. 从“被动网络”到“能动网络”:一个正在发生的范式转移 如果你最近关注AI和Web技术的前沿动态,可能会频繁听到“Agentic Web”这个词。它不像“Web3”那样带着浓厚的金融色彩,也不像“元宇宙”那样充满科幻感,但它所描绘的未来…

2026/8/18 18:23:10

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/19 4:14:38

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/18 7:12:40

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…