Python后端爬虫专题16:代码只有两个回调,数据却走了十站——从Engine到Pipeline理解Scrapy

发布时间:2026/9/30 2:31:33

Python后端爬虫专题16:代码只有两个回调,数据却走了十站——从Engine到Pipeline理解Scrapy Python后端爬虫专题16代码只有两个回调数据却走了十站——从Engine到Pipeline理解Scrapy上一篇练习完整答案授权链路是① GET/login服务器在 HTML 中给出表单 CSRF token并通过 Set-Cookie 产生targetlab_csrf② 同一个 Session POST 用户名、密码和 token请求自动携带 CSRF Cookie③ 校验成功的响应通过 Set-Cookie 产生targetlab_session④ Session GET/internal/jobs自动携带会话 Cookie。CSRF Cookie 证明 token 与发起表单的浏览器会话相符session Cookie 才代表登录身份。运行pytest tests/test_auth_session.py -q时正确账号应获得内部页面错误密码触发AuthenticationFailed底层状态为 401伪造 CSRF 得到 403。二者都不适合盲目重试凭据错误重复提交可能触发锁定CSRF 错误说明流程或页面合同已变化。可直接采用的授权清单为系统与数据负责人姓名书面授权编号和有效期允许的 scheme、host 与路径禁止字段专用只读账号权限每秒与每日限额维护窗口凭据存储和轮换责任人发现 401/403/429、数据异常或负责人撤销授权时的自动停止开关日志与快照保留期。没有这些信息技术上能登录也不代表应该采集。为什么已有 HTTPX 还要学 ScrapyJobRadar 的顺序与 asyncio 流水线适合后端开发者理解每一层Scrapy 则把请求调度、去重、下载中间件、robots、重试、节流、统计和 Feed 导出组织成成熟运行时。当来源更多、链接图更复杂、需要持续调度时它能少写大量基础设施。但迁移不意味着重写数据规则。parse_listing、parse_detail与JobItem已经经过测试Scrapy 只负责何时发请求、把响应交给哪个回调。框架适配器越薄两个采集入口越不容易产生两套字段口径。跟踪一个列表请求的完整旅程Spider 产生 Request 后Scheduler 去重并入队Engine 取出请求依次经过 downloader middlewareDownloader 发出网络请求Response 逆向经过中间件回到 EngineEngine 根据 Request.callback 调用parse回调可以 yield 新 Request 或 itemRequest 再回 Scheduleritem 则经过 Item Pipeline最后 Stats Collector 汇总计数和耗时。这里的 “Pipeline” 是 Scrapy item pipeline不等于 JobRadar 的pipeline.py应用服务。前者通常做 item 清洗、持久化或丢弃后者组织 HTTPX、快照、解析与 Repository。命名相似但调用者不同面试时应能说清。JobSpider 的两个回调构造函数接收绝对seed_url验证 scheme 与 hostname从中生成start_urls和allowed_domains。列表回调parse把response.text、response.url交给共享parse_listing为每个详情 yield 一个 Request并为 next_url yield 回到parse的分页请求。详情回调parse_job调共享解析器得到 Pydantic 模型然后model_dump(modejson)。modejson会把 date 转为字符串使 Scrapy Feed exporter 能直接序列化。若 yieldJobItem对象或 Selector下游合同就不稳定。运行本篇检查点cd project.\.venv\Scripts\python.exe-m pytest tests\test_framework_adapters.py::test_scrapy_spider_emits_detail_and_pagination_requests-q测试创建真实HtmlResponse并调用 Spider 回调断言产生两个详情 Request 和一个分页 Request还检查 callback 分别指向parse_job与parse。它不启动公网下载所以运行稳定验证的是我们的路由合同不是重测 Scrapy 的 Downloader。yield 为什么不是 return list生成器每获得一个结果就交还 Engine不必等整页所有链接装进列表后再返回。更重要的是Scrapy 会识别 yield 对象类型Request 进入调度dict 进入 item 流。若return [requests]简单场景也可能工作但失去流式表达异常位置与扩展中间件都更难理解。回调不是我们主动调用的普通业务函数而是 Engine 在响应回来后调用。因此 callback 只传函数对象self.parse_job不能写成self.parse_job()后者会在创建 Request 时立刻执行而且没有 response 参数。去重、allowed_domains和业务规范化各做什么Scheduler 的请求指纹避免相同请求重复调度allowed_domains防止链接意外爬离站点JobRadarnormalize_url清掉 fragment 和跟踪参数数据库唯一约束保证跨运行幂等。四者保护不同阶段不能说“Scrapy 自带去重所以数据库不需要唯一键”。重启、参数差异和不同 Spider 运行都可能绕开内存/磁盘调度去重。哪里会失败构造时种子不是绝对 HTTP URL应尽早 ValueError列表结构改变parse_listing返回空或明确报错详情缺字段Pydantic/PageParseError 让 item 不进入数据库网络失败由 RetryMiddleware 按配置处理。生产项目还需监听 spider_error、item_dropped 等信号把错误与业务 task_id 关联。本篇完整 Scrapy 适配模块先只理解“请求如何流动”不要急着加数据库 Pipeline。本模块刻意保持薄解析规则只有一份。下一篇会真正执行 Spider 并检查 JSON 输出。让 Scrapy 的调度能力复用 JobRadar 已验证的解析合同。fromcollections.abcimportIterablefromurllib.parseimporturlsplitimportscrapyfromscrapy.httpimportResponsefromjobradar.parsingimportparse_detail,parse_listingclassJobSpider(scrapy.Spider):采集 TargetLab 列表与详情item 字段与 JobItem 完全一致。namejobradar_jobscustom_settings{ROBOTSTXT_OBEY:True,AUTOTHROTTLE_ENABLED:True,CONCURRENT_REQUESTS_PER_DOMAIN:2,DOWNLOAD_TIMEOUT:10,RETRY_HTTP_CODES:[429,500,502,503,504],FEED_EXPORT_ENCODING:utf-8,}def__init__(self,seed_url:str,*args:object,**kwargs:object)-None:super().__init__(*args,**kwargs)partsurlsplit(seed_url)ifparts.schemenotin{http,https}ornotparts.hostname:raiseValueError(seed_url must be an absolute HTTP(S) URL)self.start_urls[seed_url]self.allowed_domains[parts.hostname]defparse(self,response:Response,**kwargs:object)-Iterable[scrapy.Request]:listingparse_listing(response.text,response.url)fordetail_urlinlisting.detail_urls:yieldscrapy.Request(detail_url,callbackself.parse_job)iflisting.next_url:yieldscrapy.Request(listing.next_url,callbackself.parse)defparse_job(self,response:Response)-Iterable[dict[str,object]]:itemparse_detail(response.text,response.url)yielditem.model_dump(modejson)本篇课后练习从start_urls开始按顺序写出 Engine、Scheduler、Downloader、Spider、Item Pipeline 之间一次详情采集的数据流。解释callbackself.parse_job与callbackself.parse_job()的区别并说明错误写法会在什么时候执行。修改 Fixture 增加一个重复详情链接观察共享解析结果与 Scrapy Scheduler 去重分别处于哪个阶段。下一篇将把 Spider 输出成真实 JSONL。
延伸阅读

更多相关文章

2026/9/30 2:31:33

SAP单SQL语句导致HANA内存溢出:从告警到修复的完整排查实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 2:31:33

【更新至2025年】2000-2025年上市公司管理层治理能力指标数据

【更新至2025年】2000-2025年上市公司管理层治理能力指标数据 1、时间:2000-2025年 2、来源:上市公司年报 3、指标:证券代码、证券简称、统计截止日期、行业代码、行业名称、行业代码1、行业名称1、产权性质、实际控制人拥有上市公司所有权…

2026/9/30 3:36:36

Vue3 + Nginx 在 Windows 部署的三大核心冲突与配置原理

1. 为什么Vue3项目在Windows上用Nginx部署,不是“能用就行”,而是“必须这样搭”你肯定试过:npm run build打包完,把dist文件夹拖进 Nginx 的html目录,双击nginx.exe启动,浏览器打开http://localhost—— 页…

2026/9/30 3:36:36

Windows安装小龙虾姿态估计工具:从环境配置到跑通全流程

实不相瞒,我第一次听到“Windows 安装小龙虾”这个说法的时候,以为是朋友发来的一道脑筋急转弯。后来才知道,他说的是GitHub上一个开源姿态估计工具,中文社区都叫它“小龙虾”。这个工具专门用来检测视频和图片里小龙虾的关键点&a…

2026/9/30 3:36:36

2004-2025研究生数学建模竞赛试题可检索题库构建与训练

第一次系统整理这套题是2016年前后,起因很简单:手上散落着几十个文件名各异的PDF,有的叫“A题.pdf”,有的叫“2013年试题”,还有的干脆是“final2(1).pdf”,想找某一届的某道题得靠回忆。后来带队伍、做赛前…

2026/9/30 3:36:36

UML图实战指南:软件工程师高效建模的8种核心图型与应用

作为软件工程师,你可能对UML的印象还停留在大学课程和软考备考资料里——一堆矩形框和箭头,画了也没有代码跑得快。工作几年后你会发现,真正让项目失控的,往往不是某段代码写得烂,而是团队对“这个模块到底是什么、之间…

2026/9/30 3:36:36

MySQL慢查询日志:从配置到优化的性能排查指南

排查MySQL性能问题,我习惯做的第一件事就是翻慢查询日志。这个文件会按照我们设定的阈值,把所有执行时间超标的SQL原原本本记录下来,是定位数据库性能瓶颈最直接的入口。不管你是后端开发、运维还是DBA,只要跟MySQL打交道&#xf…

2026/9/30 3:31:36

K8s从入门到生产实践:踩坑总结与核心原理剖析

搞K8s这几年,踩过的坑比写过的yaml都多。之前帮一个朋友排查节点初始化问题,日志停在[init] using kubernetes version: v1.26.0和[preflight] running pre-flight checks半天不动,最后发现是cgroup驱动和容器运行时没对齐,这问题…

2026/9/29 11:07:23

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/29 21:48:03

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/29 7:00:49

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 0:01:22

MATLAB+Yalmip+CPLEX实战:综合能源系统优化调度全流程解析

做综合能源系统优化调度这活儿,最痛苦的不是建模本身,而是模型写完之后不知道该怎么求解。看论文里轻飘飘一句“采用Yalmip调用CPLEX求解”,自己上手时却往往卡在环境配置、变量声明、约束写法和求解状态判读上,一耗就是两三天。这…

2026/9/30 0:01:22

I3C比I2C快10倍?RK3576实战:速率、DTS配置与混合总线避坑指南

I3C 比 I2C 快 10 倍?这句话在嵌入式群里传了很久,每次都能吵出一堆截图。前段时间我正好在 RK3576 上调板级 I3C 接口,从控制器寄存器一路摸到 Linux DTS 配置,踩了不少坑,也把这笔速度账彻底算明白了。本文就用 RK35…

2026/9/30 0:01:22

字符串转对象:JSON.parse、new Function与URLSearchParams

“字符串转对象”这几个字,我在技术群里见过的问法至少有十几种:有人拿着一串{a:1,b:2}说 JSON.parse 直接报错,有人要从 URL 里抠出参数,还有人只是想把abc变成能挂属性的东西。js 这门语言里,字符串和对象之间的转换…

2026/9/29 3:53:39

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/29 9:46:12

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/29 6:36:14

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑