Python asyncio并发陷阱:我把一个IO密集型任务的执行时间从30分钟压到3分钟

发布时间:2026/9/13 7:56:28

Python asyncio并发陷阱:我把一个IO密集型任务的执行时间从30分钟压到3分钟 Python asyncio并发陷阱我把一个IO密集型任务的执行时间从30分钟压到3分钟上周有个脚本跑了一个多小时还没结束我一度怀疑是机器出了问题。其实就是一个批量调用第三方API的定时任务从数据库里拉出一万条数据逐条调外部接口获取补充信息再写回数据库。逻辑简单到不能再简单但执行时间飙到了30分钟以上。看着终端里一条一条同步请求我突然意识到——这根本不是代码问题是并发模型选错了。问题同步请求的IO等待陷阱原始代码大概长这样importrequestsdefprocess_records(records):results[]forrecordinrecords:resprequests.get(fhttps://api.example.com/data/{record[id]})results.append(resp.json())returnresults表面上是个循环实际上每个requests.get()都在干等。网络往返假设500ms一万条数据就是 10000 × 0.5s 5000s差不多83分钟。实际因为API有速率限制和偶发超时跑了30多分钟已经算快的了。CPU占用率不到5%但任务就是跑不动。典型的CPU空转、IO阻塞场景。第一次尝试多线程但效果一般我第一反应是上多线程fromconcurrent.futuresimportThreadPoolExecutordefprocess_records_threaded(records,max_workers50):results[]withThreadPoolExecutor(max_workersmax_workers)asexecutor:futures[executor.submit(requests.get,fhttps://api.example.com/data/{r[id]})forrinrecords]forfutureinfutures:results.append(future.result().json())returnresults50个线程池跑下来时间压到了8分钟左右。 improvement 是有的但问题也很明显线程切换开销Python GIL 下50个线程的上下文切换不是免费午餐内存占用每个线程栈默认8MB50个就是400MBAPI 限流并发太高直接触发对方的429还得自己加退避逻辑能用但总觉得不够优雅。尤其是这个任务本质是IO等待用线程去抢CPU时间片有点杀鸡用牛刀。第二次尝试asyncio aiohttp质变我决定用 asyncio 重写。核心思路很简单一个线程内管理成千上万个协程IO阻塞时主动让出控制权网络响应回来再恢复执行。importasyncioimportaiohttpasyncdeffetch_one(session:aiohttp.ClientSession,record_id:str):urlfhttps://api.example.com/data/{record_id}asyncwithsession.get(url)asresp:returnawaitresp.json()asyncdefprocess_records_async(records,batch_size100):connectoraiohttp.TCPConnector(limit50,limit_per_host20)timeoutaiohttp.ClientTimeout(total30)asyncwithaiohttp.ClientSession(connectorconnector,timeouttimeout)assession:semaphoreasyncio.Semaphore(50)# 并发控制asyncdeffetch_with_limit(record):asyncwithsemaphore:returnawaitfetch_one(session,record[id])tasks[fetch_with_limit(r)forrinrecords]returnawaitasyncio.gather(*tasks)# 入口resultsasyncio.run(process_records_async(records))几个关键设计点1. TCPConnector 连接池limit50控制总连接数limit_per_host20避免对单一域名过度施压。实测下来这个参数不调的话aiohttp 默认会疯狂开连接对方服务器直接断开。2. Semaphore 并发限制50个并发是我根据对方API文档的限流策略100 req/s倒推的。Semaphore 保证了同时只有50个协程在执行网络请求其余的排队等待。3. gather 批量调度asyncio.gather()把所有任务一次性丢进事件循环由 loop 统一调度。不需要手动分片一万个协程在事件循环里跑内存占用只有协程对象本身的开销远小于线程。跑下来结果方案执行时间线程/协程数内存占用同步单线程~30分钟1~50MBThreadPoolExecutor(50)~8分钟50~450MBasyncio aiohttp(50)~3分钟1个线程 协程~80MB从30分钟压到3分钟内存还比多线程方案省了80%。踩坑记录坑1在 Jupyter 里直接await事件循环冲突Jupyter 本身已经运行了一个事件循环直接await process_records_async(records)会报RuntimeError: asyncio.run() cannot be called from a running event loop。解决办法importnest_asyncio nest_asyncio.apply()# 然后再 asyncio.run()或者直接用await而不套asyncio.run()。坑2aiohttp 默认不限制连接数导致对方拒绝服务第一次跑的时候没加TCPConnector(limit...)结果并发飙到几百API 直接返回 503。加 connector 限制后稳定了。坑3异常处理遗漏 gather 一个失败全崩默认gather()是一损俱损的某个请求抛异常整个结果列表拿不到。改成resultsawaitasyncio.gather(*tasks,return_exceptionsTrue)# 然后过滤掉异常实例success[rforrinresultsifnotisinstance(r,Exception)]坑4DNS 解析阻塞整个事件循环aiohttp 底层用 asyncio 的默认 DNS 解析某些环境下会同步调用系统 getaddrinfo卡住 loop。解决办法是装aiodnspipinstallaiodnsaiohttp 会自动识别并使用异步 DNS 解析器。写在最后这个案例让我重新思考了一个问题IO密集型任务到底该用什么并发模型CPU密集型计算、图像处理→ 多进程IO密集型 简单场景→ 多线程够用但不够精致IO密集型 高并发 资源敏感→ asyncio 是更优解Python 的 asyncio 不是银弹事件循环的调试和异常处理确实比同步代码心智负担重。但当你面对成百上千个网络请求需要并发调度时一个线程内跑几万个协程的能力是线程模型很难比拟的。最后贴一个我提炼的 checklist下次写批量IO任务之前翻一翻确认任务类型IO密集型还是CPU密集型评估并发上限对方API限流是多少我开多少合适异常兜底gather(return_exceptionsTrue)必须加连接池配置TCPConnector(limit...)必须设超时策略ClientTimeout防止请求挂死监控日志记录成功/失败/重试次数别闭着眼睛跑同步代码写了五分钟asyncio 重构加踩坑花了一下午。但看到这个脚本从30分钟压到3分钟的那一刻值了。
延伸阅读

更多相关文章

2026/9/13 22:06:44

15分钟完成黑苹果EFI配置:OpCore-Simplify图形化工具完全指南

15分钟完成黑苹果EFI配置:OpCore-Simplify图形化工具完全指南 【免费下载链接】OpCore-Simplify A tool designed to simplify the creation of OpenCore EFI 项目地址: https://gitcode.com/GitHub_Trending/op/OpCore-Simplify 还在为复杂的黑苹果配置而头…

2026/9/13 12:39:51

免费AI虚拟背景:obs-backgroundremoval终极使用指南

免费AI虚拟背景:obs-backgroundremoval终极使用指南 【免费下载链接】obs-backgroundremoval An OBS plugin for removing background in portrait images (video), making it easy to replace the background when recording or streaming. 项目地址: https://gi…

2026/9/14 4:38:38

纯前端复刻QQ音乐界面:Web课程设计实战指南

简介:面向前端初学者的QQ音乐界面模仿型Web课程设计资源,适合完成HTMLCSS课程作业、学习页面布局与交互特效的学生参考。压缩包共102个文件,主要包含HTML页面、CSS样式、JavaScript脚本、大量截图与背景音乐,包体约16.16MB&#x…

2026/9/14 4:38:38

PyTorch UNet肝脏MRI分割实战:数据预处理、模型训练与推理后处理全解

简介:一套基于PyTorch与U-Net架构的MRI肝脏图像分割完整项目方案,面向计算机专业毕业设计、课程设计以及需要医学影像实战练习的初学者。项目包含可运行的Python源码、预处理后的肝脏MRI数据集与训练好的模型权重,覆盖数据增强、模型训练、评…

2026/9/14 4:38:38

PSO优化RBF神经网络spread参数实现分类预测调参

简介:针对多特征输入的单输出分类预测任务,这份Matlab代码实现了基于粒子群算法(PSO)优化径向基神经网络(RBF)的完整流程,面向需要快速搭建PSO-RBF分类模型的科研人员与工程师。程序以扩散速度作…

2026/9/14 4:38:38

RenderCV 自定义字体指南:在简历中使用 .ttf / .otf 字体

RenderCV 自定义字体指南:在简历中使用 .ttf / .otf 字体 【免费下载链接】rendercv Resume builder for academics and engineers 项目地址: https://gitcode.com/GitHub_Trending/re/rendercv 本指南介绍 RenderCV 的自定义字体(Custom Fonts&a…

2026/9/14 4:33:37

VB6工资管理系统毕设代码接手调试与修改实战指南

简介:这是一份面向计算机专业毕业设计的VB工资管理系统完整资料包,适合需要完成课程设计、开题报告与答辩准备的学生使用。项目覆盖需求分析、系统设计、编码实现、测试优化等完整开发环节,帮助读者将VB编程与Access或SQL Server数据库知识应…

2026/9/14 2:17:50

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/14 0:03:22

KCF目标跟踪算法与OTB工程实现:毕业设计实战解析

简介:这是一份基于KCF核相关滤波算法、融合尺度池与抗遮挡处理的目标检测跟踪MATLAB完整源码,主要面向计算机相关专业准备毕业设计、课程设计或期末大作业的学生,也适合需要项目实战练习的初学者。源码在OTB数据集上完成验证,能够…

2026/9/14 0:03:22

语音情感识别实战:Keras实现LSTM、CNN、SVM与MLP多模型对比

简介:面向语音情感识别入门与进阶开发者,这份基于Keras的项目源码完整实现了LSTM、CNN、SVM、MLP四种模型,兼容Python3.8与Keras/TensorFlow2环境。压缩包内含49个文件,大小约70.31MB,主体包括Python脚本、yaml/json配…

2026/9/12 6:29:36

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/12 14:32:17

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/13 11:18:28

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码