Qwen-Agent 是怎么把 100 页 PDF 读给 AI 的?文档分块与存储 3 个机制全解析

发布时间:2026/9/10 17:53:55

Qwen-Agent 是怎么把 100 页 PDF 读给 AI 的?文档分块与存储 3 个机制全解析 Qwen-Agent 是怎么把 100 页 PDF 读给 AI 的文档分块与存储 3 个机制全解析【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent把一份 200 页的 PDF 丢给 Qwen-Agent 做多文档问答模型经常只看到前几页内容。问题出在文档分块上块太大超上下文块太小断语境同一文件还会被反复解析。下面拆开 Qwen-Agent 的 DocParser Storage 这两个工具看它怎么把文件变成可检索的文本块。完整数据流从文件上传到分块召回主线是一条链路解析 → 数 token → 分块 → 缓存 → 检索。两个工具分工doc_parser.py 负责切storage.py 负责存。分块和检索都先查缓存同一个文件问第二次不会重新解析。什么时候分块token 阈值决定切不切它解决白干活问题小文档塞得下没必要再切。先数全篇 token再跟阈值比if total_token max_ref_token: content [Chunk(contentget_plain_doc(doc), ...)] # 整篇文档当 1 个 chunk else: content self.split_doc_to_chunk(doc, url, titletitle, parser_page_sizeparser_page_size)max_ref_token默认 20000。全文不到 2 万 token 就不切超了才走分块算法。这个阈值是个粗粒度开关只看体量不看结构图省事设成一个数字你可以通过环境变量QWEN_AGENT_DEFAULT_MAX_REF_TOKEN调大匹配更大的模型上下文。chunk 怎么切先段落、再句子、最后按 token 硬切它解决长文档怎么均匀切开、又不把语境切断的问题。算法是三级降级整段塞段落超过当前 chunk 剩余 token 就不强塞单段太长就按句子切中文用。英文用.逐句装单句还装不下用 tokenizer 直接按 token 截断。_sentences re.split(r\. |。, txt) # 段落先拆成句子每个 chunk 最多parser_page_size个 token默认 500。注意 chunk 内容开头带[page: N]页码标记回答时能溯源到第几页。chunk 重叠为什么设 150 字符按段落边界切开时上一块的末尾句子可能正是下一块理解的前提。_get_last_part从上一块末尾往前取末尾段落不足 150 字符就整段拿来段落太长就按句回溯凑满 150 字符的完整句子塞进下一块开头def _get_last_part(self, chunk: list) - str: available_len 150 for i in range(len(chunk) - 1, -1, -1): # 从块尾往前回填到 150 字符为止且不切半句话取舍是重叠内容会重复占 token。但相比语境断裂的代价值得。150 字符上限也防止重叠吃掉整个 chunk 的预算。缓存键怎么拼URL 哈希 分块参数它解决同一个文件被反复解析的问题。缓存键由两部分拼成cached_name_chunking f{hash_sha256(url)}_{str(parser_page_size)} try: record json.loads(self.db.get(cached_name_chunking)) return record # 命中缓存直接跳过解析 except KeyNotExistsError: doc self.doc_extractor.call({url: url}) # 没命中才现场解析URL 的 SHA-256 哈希当文件名再拼上parser_page_size。为什么拼参数同一份文件按 500 和按 1000 切出来的块不一样参数进键两套结果互不覆盖。存储本身很朴素一个 key 对应一个文本文件默认落在workspace/tools/storage/目录肉眼可查不用接数据库。跑起来多文档问答 3 行启动pip install -U qwen-agent[rag,gui] python examples/parallel_doc_qa.py脚本在 examples/parallel_doc_qa.py。进网页后上传文件提问agent 先把文件拆开做并行子问答再用 retrieval 工具召回相关 chunk 汇总答案。想改代码先git clone https://gitcode.com/GitHub_Trending/qw/Qwen-Agent到本地再动手。调参清单parser_page_size默认 500→ 文档长句多、希望块内语境更完整时 → 调大到 800~1000 → chunk 数变少检索命中整段更稳。max_ref_token默认 20000→ 模型上下文大、小文档想绕过分块时 → 调大 → 整篇成一个 chunk检索和回答更快。QWEN_AGENT_DEFAULT_WORKSPACE→ 知识库文件多、磁盘慢时 → 指向更快的磁盘 → 缓存读写更快。分、切、缓存这三件事是 Qwen-Agent 文档知识库的地基。想看召回排序怎么做去 search_tools/ 目录。【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/10 17:53:55

基于雨流计数法的源-荷-储双层协同优化配置及Matlab实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/10 17:53:54

门店库存系统数据准确性分析:从技术层面如何选型评估

在实体门店数字化运营中,库存数据失真属于高频且隐蔽的核心问题。库存账实不符、订单占用统计偏差、成本核算混乱、多渠道数据不同步等问题,会直接导致门店超卖、缺货积压、利润核算不准,长期影响门店的资金周转与经营决策。多数中小门店选用…

2026/9/10 17:48:54

无刷双馈电机原理、控制与应用全解析

1. 无刷双馈电机的独特魅力 第一次接触无刷双馈电机(Brushless Doubly-Fed Machine,简称BDFM或BDFIG)是在2015年的一个风电项目现场。当时工程师指着机舱里那个比传统双馈电机小一号的设备说:"这玩意儿不用碳刷,维…

2026/9/10 18:44:06

列表推导式 vs 生成器表达式,一次说透内存与性能差异

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/10 18:44:06

语音通知接口开发指南:核心价值与实现方案

1. 语音通知接口的核心价值与应用场景在移动应用开发中,语音通知接口正逐渐成为提升用户体验的关键组件。相比传统的短信通知,语音通知具有更高的触达率和即时性——根据行业实测数据,在金融、物流等关键业务场景中,语音通知的打开…

2026/9/10 18:44:06

数据采集技术全解析:从基础概念到实战应用

1. 数据采集基础概念解析数据采集作为数据分析流程的第一步,其重要性不言而喻。简单来说,数据采集就是从各种数据源获取原始数据的过程,这些数据源可能包括网站、数据库、传感器、日志文件等。在实际工作中,我发现很多新手容易把数…

2026/9/10 18:39:06

桌面Agent不是高级宏:语义理解驱动的智能自动化

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 0:00:55

目录对比去重实战:用哈希算法精准清理重复文件

我电脑里现在还有一块换了三次机的“数据墓地”硬盘,里面存着2016年以前所有旧笔记本的完整备份。平时不觉得有什么,直到前阵子想把它整理归档,发现同一个安装包、同一批照片、同一份论文草稿,在几个不同的备份目录里反复出现。更…

2026/9/10 0:00:55

Leaflet离线地图完整Demo合集:内网部署与坐标纠偏实战

简介:这是一份面向Web GIS开发者的LeafLet离线地图示例合集,帮助开发者快速掌握离线地图从搭建到交互的完整流程。压缩包共723个文件,大小14.06MB,以319个js脚本、175个html页面和29个css样式文件为主体,配合png/svg图…

2026/9/10 0:00:55

MATLAB读取Rinex 3.02观测文件:多系统GNSS数据解析实战

简介:基于MATLAB开发的Rinex3.02版观测文件(o文件)读取代码包,面向卫星定位导航方向的学习者与研究人员,用于解决新版观测文件的数据解析、历元提取与时间转换问题。压缩包共4个文件,包含两个m脚本、一个19…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码