发布时间:2026/8/6 5:04:41
73.高级RAG-后检索器(文档过滤) 内容参考于图灵AI大模型全栈过滤它的作用是处理检索出来的数据比如说之前通过BM25词频率检索出来的文档由于我们非要让它返回多个文档数据导致有些都是0分那么这些0分的就没必要拼接到提示词中给大模型了或者说低于多少分比如低于0.7、0.5这个分数很低的相关性可能就不会很大所以就不要给大模型了所以过滤的功能是把检索出来的一些相关性不高的文档删掉一般0.7分以上的就是属于很相似的llamaindex文档地址:https://developers.llamaindex.ai/python/framework-api-reference/postprocessor/效果图下图中是检索出来的所以文档和文档的相关性分数下图红框是通过下图蓝框过滤器来过滤0.7分以下的数据得到的最终相关性的文档代码注意如果给RetrieverQueryEngine传递了node_postprocessors参数就不需要自己手动调用后处理器的代码了所以说下方 retriever.retrieve和similarity_processor.postprocess_nodes代码可以删了from llama_index.core import ( SimpleDirectoryReader, VectorStoreIndex ) from llama_index.core.node_parser import SentenceSplitter from llama_index.core.postprocessor import SimilarityPostprocessor from llama_index.core.query_engine import RetrieverQueryEngine from base_llm import embed_model, llm # 读取文档 documents SimpleDirectoryReader( input_files[./data_file/公司规章制度.txt] ).load_data() # 文档分割器 parser SentenceSplitter( chunk_size300, chunk_overlap50 ) # 创建索引 index VectorStoreIndex( parser.get_nodes_from_documents(documents), embed_modelembed_model ) # 创建检索器返回15个相关文档但是不可能把15个都给大模型所以需要后续使用后处理来处理检索出来的文档 # 广撒网捞大鱼丢小鱼 retriever index.as_retriever(similarity_top_k15) # 先多召回15条 # 创建相似度的后处理器小于0.7分就直接不要了 similarity_processor SimilarityPostprocessor(similarity_cutoff0.7) # 创建问题查询引擎 query_engine RetrieverQueryEngine.from_args( # 设置检索器 retrieverretriever, # 设置大模型 llmllm, # 设置后处理器后处理器可以传递多个 # 所以说可以对文档进行不同的过滤处理比如过滤和重排重排是后面的内容这里只写过滤 # 执行顺序从上往下依次执行 node_postprocessors[ similarity_processor, ], ) # 问题 query 公司上下班时间 # response query_engine.query(query) print( LLM回答 ) print(response) # 下方的代码retriever.retrieve和similarity_processor.postprocess_nodes是在不给 RetrieverQueryEngine.from_args 传递node_postprocessors参数的情况下写的 # 如果传递了node_postprocessors参数直接使用RetrieverQueryEngine.from_args(xx).query(query)就可以了 nodes retriever.retrieve(query) print(\n 检索节点分数 ) for node in nodes: print(fScore: {node.score:.3f} | Text: {node.text[:100]}...) # 把检索出来的文档节点给到后处理器这里是过滤小于0.7分的 # nodes就是通过检索器查出来的跟问题相关的文档节点 res similarity_processor.postprocess_nodes(nodes) print(res)

相关新闻

2026/8/6 5:04:41

基于OpenClaw与LLM构建智能股票异动监控系统实战

1. 项目概述:当小龙虾遇上股票异动最近在量化圈和AI智能体圈子里,一个叫OpenClaw(大家戏称“小龙虾”)的开源项目火得不行。它本质上是一个AI智能体框架,能让大语言模型(LLM)像人一样去操作电脑…

2026/8/6 5:04:41

OpenClaw安装遇阻?三大AI智能体平替方案深度解析

1. 项目概述:当OpenClaw安装遇阻,我们还有哪些选择?最近在AI智能体这个圈子里,OpenClaw(大家戏称“小龙虾”)的热度一直居高不下。作为一个开源的AI智能体框架,它主打的就是让开发者能相对轻松地…

2026/8/6 5:04:41

电脑电源故障诊断与维修指南:从症状识别到内部拆解

1. 从一次深夜宕机说起:电源故障的普遍性与隐蔽性那天晚上,我正在渲染一段4K视频,机器风扇全速运转,屏幕上的进度条缓慢爬升。突然,显示器一黑,主机发出一声轻微的“噗”声,随后便陷入了死寂。按…

2026/8/6 6:04:45

C++图论算法精讲:从邻接表实现到最短路径与最小生成树

1. 从“图”说起:为什么我们需要一种新的数据结构?如果你写过链表、树或者堆,可能会觉得数据结构的世界已经足够丰富了。链表处理线性关系,树处理层次关系,堆处理优先级。但当我们面对更复杂的关系时,比如社…

2026/8/6 6:04:45

这颗1.8V的8Gb SLC,可能是今年工控圈的“版本答案”

在嵌入式存储选型中,工程师常常面临几个进退两难的处境。SPI NOR Flash在容量超过1Gb后价格急剧攀升,成本上难以接受;eMMC虽然功能完善,但对于RTOS或轻量级Linux系统而言,协议栈太重,外围电路也相对复杂&am…

2026/8/6 6:04:45

一手供应链哪里找?用四步筛选源头货源

找一手供应链,最难的通常不是找不到联系方式,而是无法判断对方究竟是生产厂家、品牌方、总代,还是经过多层转手的普通供货商。网上大量信息都在强调“厂家直供”“源头低价”,但对采购方来说,真正重要的并不只是价格&a…

2026/8/6 6:04:45

VHDL与Logisim实现嵌入式系统优先级仲裁器设计

1. 从“抢车位”到“仲裁器”:嵌入式系统资源分配的底层逻辑在嵌入式系统的世界里,资源永远是稀缺的。想象一下一个十字路口,只有一条车道,却同时有来自东、西、南、北四个方向的车辆都想通过。如果没有任何交通规则,结…

2026/8/6 6:04:45

MySQL部署实战:从安装到生产级配置的完整指南

最近在整理一些旧项目的数据库迁移,发现很多早期项目还在用着老版本的 MySQL,升级过程中各种兼容性问题层出不穷。这让我想起一个更常见、也更基础的问题:很多开发者,尤其是刚开始接触后端或数据存储的朋友,在第一步—…

2026/8/6 5:59:45

Ansys SpaceClaim几何修复与直接建模:仿真前处理高效解决方案

1. 项目概述:为什么是SpaceClaim?如果你是一名机械工程师、结构分析师或者产品设计师,大概率听说过甚至用过Ansys Workbench。在传统的仿真流程里,我们常常卡在第一步:几何处理。从CAD软件导出的模型,十有八…

2026/8/5 3:13:11

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/6 0:04:22

电力系统调度中的源荷不确定性建模与优化实践

1. 电力系统调度中的源荷不确定性挑战现代电力系统正面临前所未有的复杂性,其中源荷不确定性(Source-Load Uncertainty)已成为调度决策中最棘手的难题之一。我在参与某省级电网调度系统升级时,曾遇到风电预测误差导致日内调度计划…

2026/8/6 0:04:22

VGG-T3技术解析:3D重建速度的革命性突破

1. 项目概述:VGG-T3如何重新定义3D重建速度在计算机视觉领域,3D场景重建一直是个计算密集型任务。传统方法重建1000帧图像规模的场景往往需要数小时甚至更长时间,而英伟达最新发布的VGG-T3技术将这个时间压缩到了惊人的54秒。这个突破性进展来…

2026/8/6 0:04:22

深度解析旅游网站建设的意义及其对行业发展的深远影响与核心价值体现

在这个数字化浪潮席卷全球的今天,我们似乎已经忘记了,曾经有一段时间,人们想要去一个陌生的地方,只能靠在书桌前翻阅厚厚的旅游杂志,或者向刚从那里回来的朋友询问那些模糊不清的印象。那时候,“远方”是一个需要精打细算才能抵达的奢侈概念。而现在,只需要一部手机,轻…

2026/8/5 19:21:13

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/5 19:21:13

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/5 19:21:13

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…