Scrapy 爬虫框架完整文档

发布时间:2026/9/10 18:59:46

Scrapy 爬虫框架完整文档 Scrapy 爬虫一、概述Scrapy读作 /ˈskreɪpaɪ/是一个快速、高级的Web爬取和Web抓取框架用于爬取网站并从其页面中提取结构化数据。它可用于数据挖掘、信息处理、历史存档等多种用途。Scrapy是Python生态中高性能的工业级爬虫框架基于Twisted异步架构支持高并发、自动去重、重试与反爬。其设计核心在于通过“引擎-调度器-下载器-爬虫-管道”的协作模式实现从页面抓取、数据解析到持久化的全流程自动化。Scrapy的核心优势异步架构基于Twisted事件驱动能以单线程实现高并发请求处理模块化设计内置Spider、Item、Pipeline等模块实现标准化流程内置反爬机制请求去重、自动重试、User-Agent轮换等可扩展性强支持中间件、扩展、信号等自定义机制核心组件Scrapy框架主要由以下组件构成组件功能说明Engine引擎负责控制数据流在系统中各组件间触发事件Scheduler调度器接收引擎发来的请求将其加入队列并在引擎再次请求时提供Downloader下载器获取网页内容并将响应返回给引擎Spiders爬虫定义如何爬取特定网站的规则和解析逻辑Item Pipeline管道处理爬取到的数据进行清洗、验证和存储Downloader Middlewares下载中间件在请求/响应处理过程中进行全局修改Spider Middlewares爬虫中间件处理Spider的输入响应和输出请求/数据二、安装与环境搭建2.1 安装ScrapyScrapy支持Python 3.7及以上版本推荐使用Python 3.8。使用pip安装bashpip install scrapy使用国内镜像源加速安装bashpip install scrapy -i https://pypi.douban.com/simple验证安装是否成功bashscrapy version如果看到类似Scrapy 2.x.x的版本号输出说明安装成功。2.2 安装注意事项Windows用户可能需要先安装Microsoft Visual C Build Tools以解决某些依赖包的编译问题Linux/macOS用户一般可直接安装如遇权限问题可使用sudo pip install scrapy三、创建Scrapy项目3.1 项目初始化使用startproject命令创建新项目bashscrapy startproject tutorial3.2 项目目录结构创建成功后项目目录结构如下texttutorial/ ├── scrapy.cfg # 部署配置文件 ├── tutorial/ # 项目的Python模块 │ ├── __init__.py │ ├── items.py # 数据结构定义 │ ├── middlewares.py # 中间件配置 │ ├── pipelines.py # 数据处理管道 │ ├── settings.py # 项目设置 │ └── spiders/ # 爬虫代码存放目录 │ └── __init__.py四、定义数据结构Items在items.py中定义要抓取的数据字段pythonimport scrapy class QuoteItem(scrapy.Item): text scrapy.Field() # 名言文本 author scrapy.Field() # 作者 tags scrapy.Field() # 标签列表五、编写爬虫Spider5.1 第一个爬虫在spiders/目录下创建爬虫文件例如quotes_spider.pypythonimport scrapy class QuotesSpider(scrapy.Spider): name quotes # 爬虫唯一标识符 start_urls [ # 起始URL列表 https://quotes.toscrape.com/page/1/, ] def parse(self, response): # 遍历页面中的每个名言区块 for quote in response.css(div.quote): yield { author: quote.xpath(span/small/text()).get(), text: quote.css(span.text::text).get(), tags: quote.css(a.tag::text).getall(), } # 处理翻页查找下一页链接并继续爬取 next_page response.css(li.next a::attr(href)).get() if next_page is not None: yield response.follow(next_page, self.parse)5.2 代码解析代码元素说明name quotes爬虫的唯一名称在同一项目中必须唯一start_urls [...]起始URL列表Scrapy会自动为每个URL创建请求def parse(self, response)默认回调函数处理响应response.css(...)CSS选择器提取数据response.xpath(...)XPath选择器提取数据yield {...}生成字典数据传递给Item Pipelineresponse.follow()创建新请求跟进链接5.3 运行爬虫在项目根目录下执行bashscrapy crawl quotes -o quotes.json运行后Scrapy会自动从第一页开始抓取提取每条名言的信息并自动翻页直到抓取完所有页面。5.4 使用runspider快速运行如果不想创建完整项目也可以直接运行单个爬虫文件bashscrapy runspider quotes_spider.py -o quotes.jsonl六、数据选择器Scrapy内置了强大的选择器机制支持CSS选择器和XPath表达式。6.1 CSS选择器python# 选择所有class为quote的div元素 response.css(div.quote) # 提取元素的文本内容 response.css(span.text::text).get() # 提取多个元素的文本列表 response.css(a.tag::text).getall() # 提取元素的属性值 response.css(li.next a::attr(href)).get()6.2 XPath选择器python# 选择所有span下的small元素的文本 response.xpath(//span/small/text()).get() # 选择所有div.quote response.xpath(//div[classquote])6.3 选择器快捷方式Response对象提供了response.css()和response.xpath()两个快捷方法python# 两种方式等价 response.selector.xpath(//span/text()).get() response.xpath(//span/text()).get()七、Item Pipeline数据处理管道Item在爬虫中被抓取后会发送到Item Pipeline进行后续处理。7.1 Pipeline的典型用途清洗HTML数据验证爬取的数据检查是否包含某些字段检查并丢弃重复项将爬取的数据存储到数据库7.2 编写自定义Pipeline在pipelines.py中实现pythonimport json from itemadapter import ItemAdapter from scrapy.exceptions import DropItem class PricePipeline: 价格验证和调整的Pipeline示例 vat_factor 1.15 def process_item(self, item): adapter ItemAdapter(item) if adapter.get(price): if adapter.get(price_excludes_vat): adapter[price] adapter[price] * self.vat_factor return item else: raise DropItem(Missing price)7.3 存储到JSON Lines文件pythonimport json from itemadapter import ItemAdapter class JsonWriterPipeline: def open_spider(self, spider): self.file open(items.jsonl, w) def close_spider(self, spider): self.file.close() def process_item(self, item, spider): line json.dumps(ItemAdapter(item).asdict()) \n self.file.write(line) return item7.4 存储到MongoDBpythonimport pymongo from itemadapter import ItemAdapter class MongoPipeline: collection_name scrapy_items def __init__(self, mongo_uri, mongo_db): self.mongo_uri mongo_uri self.mongo_db mongo_db classmethod def from_crawler(cls, crawler): return cls( mongo_uricrawler.settings.get(MONGO_URI), mongo_dbcrawler.settings.get(MONGO_DATABASE, items) ) def open_spider(self, spider): self.client pymongo.MongoClient(self.mongo_uri) self.db self.client[self.mongo_db] def close_spider(self, spider): self.client.close() def process_item(self, item, spider): self.db[self.collection_name].insert_one(ItemAdapter(item).asdict()) return item7.5 启用Pipeline在settings.py中配置pythonITEM_PIPELINES { tutorial.pipelines.PricePipeline: 300, tutorial.pipelines.JsonWriterPipeline: 800, }数字表示Pipeline的执行顺序数值越小越先执行。八、中间件Middleware8.1 Downloader Middleware下载中间件下载中间件是Scrapy请求/响应处理的钩子框架用于全局修改请求和响应。启用下载中间件pythonDOWNLOADER_MIDDLEWARES { myproject.middlewares.CustomDownloaderMiddleware: 543, }自定义下载中间件示例pythonclass CustomDownloaderMiddleware: def process_request(self, request, spider): # 在请求发送前处理 # 返回None继续处理返回Response则直接返回返回Request则重新调度 return None def process_response(self, request, response, spider): # 在响应返回后处理 return response8.2 Spider Middleware爬虫中间件爬虫中间件用于处理发送给Spider的响应以及Spider生成的请求和Item。启用爬虫中间件pythonSPIDER_MIDDLEWARES { myproject.middlewares.CustomSpiderMiddleware: 543, }8.3 常用中间件场景User-Agent轮换避免被识别为爬虫代理IP设置突破IP限制Cookie管理维持登录状态请求重试处理网络异常九、常用命令命令说明scrapy startproject 项目名创建新项目scrapy genspider 爬虫名 域名生成爬虫模板scrapy crawl 爬虫名运行爬虫scrapy crawl 爬虫名 -o 文件运行并输出到文件scrapy runspider 文件直接运行爬虫文件scrapy shell URL进入交互式Shell调试scrapy version查看版本十、完整实战示例10.1 项目创建bashscrapy startproject quotes_project cd quotes_project10.2 定义Itemitems.pypythonimport scrapy class QuoteItem(scrapy.Item): text scrapy.Field() author scrapy.Field() tags scrapy.Field()10.3 编写爬虫spiders/quotes_spider.pypythonimport scrapy from quotes_project.items import QuoteItem class QuotesSpider(scrapy.Spider): name quotes start_urls [http://quotes.toscrape.com/page/1/] def parse(self, response): for quote in response.css(div.quote): item QuoteItem() item[text] quote.css(span.text::text).get() item[author] quote.css(small.author::text).get() item[tags] quote.css(a.tag::text).getall() yield item next_page response.css(li.next a::attr(href)).get() if next_page: yield response.follow(next_page, self.parse)10.4 配置Pipelinepipelines.pypythonimport json from itemadapter import ItemAdapter class JsonWriterPipeline: def open_spider(self, spider): self.file open(quotes.jsonl, w) def close_spider(self, spider): self.file.close() def process_item(self, item, spider): line json.dumps(ItemAdapter(item).asdict()) \n self.file.write(line) return item10.5 启用Pipelinesettings.pypythonITEM_PIPELINES { quotes_project.pipelines.JsonWriterPipeline: 300, }10.6 运行爬虫bashscrapy crawl quotes十一、高级特性11.1 处理动态加载内容对于使用JavaScript动态生成的内容可以结合Selenium使用pythonfrom scrapy_selenium import SeleniumRequest class DynamicSpider(scrapy.Spider): name dynamic def start_requests(self): yield SeleniumRequest( urlhttp://example.com, callbackself.parse ) def parse(self, response): # 解析已渲染的页面内容 pass在settings.py中配置pythonDOWNLOADER_MIDDLEWARES { scrapy_selenium.SeleniumMiddleware: 800, }11.2 分布式爬虫Scrapy-RedisScrapy-Redis扩展实现了分布式爬虫通过Redis共享请求队列pythonfrom scrapy_redis.spiders import RedisSpider class CtripHotelSpider(RedisSpider): name ctrip_hotel allowed_domains [flights.ctrip.com] redis_key ctrip_hotel:start_urls # Redis中的起始URL队列11.3 爬虫参数传递运行爬虫时传递参数bashscrapy crawl quotes -a categoryhumor在爬虫中接收参数pythonclass QuotesSpider(scrapy.Spider): name quotes def __init__(self, categoryNone, *args, **kwargs): super(QuotesSpider, self).__init__(*args, **kwargs) self.category category十二、调试与测试12.1 Scrapy ShellScrapy Shell是一个交互式环境用于测试数据提取代码bashscrapy shell https://quotes.toscrape.com/page/1/进入Shell后可以测试选择器pythonresponse.css(div.quote) response.xpath(//div[classquote])12.2 查看爬取结果使用-o参数输出到文件bashscrapy crawl quotes -o quotes.json # JSON格式 scrapy crawl quotes -o quotes.jsonl # JSON Lines格式 scrapy crawl quotes -o quotes.csv # CSV格式十三、最佳实践与注意事项遵守robots.txtScrapy默认遵守网站的robots.txt协议设置下载延迟在settings.py中设置DOWNLOAD_DELAY避免对目标网站造成压力使用User-Agent轮换避免被识别为爬虫处理异常使用中间件处理请求失败、超时等异常数据去重利用Scrapy内置的去重过滤器合理设置并发通过CONCURRENT_REQUESTS控制并发数日志记录使用Scrapy的日志系统记录爬取过程十四、参考资源官方文档https://docs.scrapy.org[reference:44]官方示例项目quotesbothttps://github.com/scrapy/quotesbot[reference:45]Scrapy官网https://scrapy.org[reference:46]
延伸阅读

更多相关文章

2026/9/11 1:25:48

2026年AI训练算力租赁怎么选:五大维度解析权益云实力

前言随着大模型技术持续演进,万亿参数级模型训练已成常态。算力供给的结构性短缺,使得算力租赁成为企业AI研发的主流选择。然而,2026年的算力租赁市场已从早期的粗放式供给,转向精细化服务比拼。面对众多服务商,如何从…

2026/9/2 10:47:07

AI时代下WebUI自动化实施架构图

这是一个非常经典的技术演进问题。从传统自动化到 AI Agent 驱动,不仅是工具的替换,更是架构范式的根本转变。为了清晰地展示这种差异,我将架构图分为三个时代、四层逻辑:传统时代(Selenium 时代)&#xff…

2026/9/11 14:17:08

基于Java的智能网联汽车模拟实操训练系统设计与实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/11 14:17:08

直播电商数据采集与可视化:基于Python和小程序的完整实践

1. 项目整体设计与方案选型先说一下为什么做这套系统。我一直在帮几个做直播带货的朋友做数据复盘,发现一个特别头疼的问题:每天直播结束后,想弄清楚当晚究竟哪些商品卖得好、哪个时段流量最高、观众对哪类商品停留时间更久,几乎全…

2026/9/11 14:17:08

Windows下Log4j日志ANSI转义序列问题解析与解决方案

1. Windows平台下Log4j日志输出数字问题的现象与背景最近在Windows服务器上部署Java应用时,发现Log4j输出的日志文件中频繁出现类似[1m[32m这样的数字序列。这些数字并非业务日志内容,而是混杂在正常日志中的特殊字符。这种现象在Linux环境下并不常见&am…

2026/9/11 14:17:08

【JAVA毕业设计】基于 SpringBoot + 小程序的前后端分离诊所预约挂号系统的设计与实现(源码+文档+远程调试,全bao定制等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/11 14:12:07

GPT-6 Astra提示词指南:如何用slop词黑名单消除AI味

这周圈子里最热闹的事,莫过于OpenAI把GPT-6 Astra带到了台前。我更新模型后的第一件事,就是拿它把我去年攒的那堆旧提示词全部跑了一遍。结果很分裂:文章框架、逻辑、信息密度都比以前好太多,但读起来还是那副熟悉的味道——"…

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码