pyspider任务调度系统详解:优先级队列、重试策略与Token Bucket流量控制完全指南
pyspider任务调度系统详解优先级队列、重试策略与Token Bucket流量控制完全指南【免费下载链接】pyspiderA Powerful Spider(Web Crawler) System in Python.项目地址: https://gitcode.com/gh_mirrors/py/pyspiderpyspider 是一款强大的 Python 爬虫Spider系统它的 Scheduler 调度器是整个系统的心脏优先级队列决定哪些任务先执行重试策略让失败任务按指数退避自动恢复而 **Token Bucket令牌桶**算法则精准控制每个项目的抓取速率避免触发目标网站的反爬机制。本文带你从零理解这三套机制的设计原理并学会在脚本中配置priority、retries、age等参数让你的爬虫既快又稳。上图是 pyspider 的 WebUI 项目列表注意rate/burst这一列——它正是每个项目流量控制Token Bucket的速率设置点击即可修改。一、调度器在整个爬虫系统里的位置pyspider 的组件之间通过消息队列通信各司其职参见 docs/Architecture.mdScheduler调度器从 Processor 接收新任务判断是新任务还是需要重爬按优先级排序后投递给 Fetcher同时负责周期性任务、丢失任务和失败任务的重试Fetcher抓取器真正发起 HTTP 请求支持 JS 渲染页面Processor处理器运行你的爬虫脚本产出解析结果和新任务Result Worker结果处理器保存抓取结果调度器的工作循环每 0.1 秒执行一次LOOP_INTERVAL 0.1每轮依次完成更新项目状态 → 检查任务完成状态 → 检查新任务 → 触发定时任务every→ 选择任务投递 → 清理过期项目。核心循环代码见 scheduler.py 中的run_once方法。二、优先级队列决定任务执行顺序的核心每个项目在调度器中都持有一个独立的 TaskQueue它内部由三个队列协作完成调度队列职责说明priority_queue优先级队列存放可立即执行的任务堆排序优先级数字越大越先执行time_queue延迟队列存放未到执行时间的任务exetime到期后转入优先级队列processing处理中队列跟踪已投递、未返回结果的任务超时 10 分钟自动重新排队任务如何比较先后队列中的每个任务封装为 InQueueTask比较规则非常精巧__cmp__方法延迟任务优先设置了exetime未来执行时间的任务时间早的排在前面优先级次之exetime0的任务按priority从高到低排列全局序号兜底前两者都相同时按入队的全局自增序号排列——这解决了堆排序下先进后出的隐患保证同优先级任务严格 FIFO还有一个关键设计相同 taskid 的任务会自动合并。如果同一个 URL 再次被提交只会取两者中更高的 priority 和更早的 exetime队列长度不会无限膨胀这就是为什么大流量爬虫也不会撑爆内存。多项目如何公平分配调度器每轮最多投递LOOP_LIMIT 1000个任务。多个项目运行时每个项目分到的份额与它的队列长度成正比动态加权但设有上下限每个项目最少分到 10% 的配额limit/10每个项目最多占 33% 的配额limit/3这意味着即使某个项目积压了 10 万个任务也不会把其他项目的配额全部挤占——小项目永远有保底的执行机会。该逻辑在 scheduler.py 的_check_select方法中实现。三、重试策略失败任务如何自动恢复爬虫失败是常态——网络抖动、目标站限流、临时 5xx。pyspider 用三层防线优雅地处理失败1. 默认指数退避表调度器内置了一张默认重试延迟表 DEFAULT_RETRY_DELAY第几次重试后延迟时间第 0 次30 秒第 1 次1 小时第 2 次6 小时第 3 次12 小时超过上限24 小时任务失败后调度器会读取该任务retries默认 3 次与retried已重试次数的差值决定还能重试把任务放回延迟队列time_queue延迟retry_delay[retried]秒后重新执行重试耗尽任务状态置为 FAILED等待人工介入或age到期后重新激活2. 自定义重试延迟你可以在爬虫脚本中直接覆盖retry_delay类属性定义于 base_handler.py比如对频繁限流的目标站设置更保守的退避class Handler(BaseHandler): retry_delay { 0: 60, # 第一次失败后 1 分钟重试 1: 30 * 60, # 第二次失败后 30 分钟 2: 3 * 60 * 60, : 48 * 60 * 60, # 兜底48 小时 }3. 连续失败自动暂停防雪崩这是很容易被忽视的亮点当某项目连续 10 个任务全部失败时FAIL_PAUSE_NUM 10调度器会把该项目自动暂停 5 分钟PAUSE_TIME。暂停结束后进入观察期再试 3 个任务UNPAUSE_CHECK_NUM成功则恢复运行仍然全失败则继续暂停。这个机制相当于爬虫的熔断器——当目标站明显在封你时自动踩下刹车避免无效请求越刷越多、IP 被永久拉黑。状态机逻辑见 scheduler.py 中Project.paused属性。4. 处理超时自动重投任务投递后 10 分钟processing_timeout内没有返回结果会被认为丢失自动回到优先级队列重新执行。这保证了即使 Fetcher 进程崩溃任务也不会永久卡死。四、Token Bucket 流量控制给爬虫装上限速器每个项目的抓取速率由 token_bucket.py 中的Bucket类控制采用经典的令牌桶算法rate速率每秒产生的令牌数即每秒允许的请求数burst突发令牌桶的容量上限默认是 rate 的 10 倍允许短时间突发工作机制非常直白桶里每秒按rate速度注水令牌最多存burst个调度器每次要取任务前先向桶申请 1 个令牌——桶空则本轮一个任务都不发。这样既保证了长期平均速率稳定又保留了突发弹性比如刚启动时桶是满的可以瞬间消化一批任务。在哪里设置直接在 WebUI 项目列表中点击rate/burst数值即可修改如上图所示也可以在项目配置中设置。注意 WebUI 侧还有max_rate/max_burst全局上限保护见 index.py防止误操作把目标站打挂。 实用建议对公开站点rate0.2~1通常足够对限流严格的站点可设rate0.1, burst1让请求间隔稳定在 10 秒左右。五、脚本中常用调度参数速查调度机制最终都通过self.crawl的参数暴露给你完整文档见 self.crawl参数作用默认值priority任务优先级越大越先执行0retries失败后最大重试次数3age任务有效期期内重复提交将被忽略-1永不重爬exetime指定执行时间戳实现延迟执行0立即auto_recrawl启用后按age周期自动重爬Falseitag内容变更标记变化时触发重爬None配合 every 装饰器定时任务与config(age...)按回调批量设置默认参数基本可以覆盖所有调度场景every(minutes60) # 每小时定时触发 def on_start(self): self.crawl(https://example.com/news, callbackself.index_page) config(age2 * 60 * 60) # 列表页 2 小时内不重复抓取 def index_page(self, response): for url in response.doc(.news a).attr.url: self.crawl(url, callbackself.detail, priority1)六、小结三大机制如何协同一次完整的任务生命周期会依次经过三道关卡入场关新任务经过 taskid 去重、age有效期检查后进入优先级队列或延迟队列执行关从队列取出任务前Token Bucket 检查令牌保证速率不超过 rate/burst 设定结果关成功则记录lastcrawltime失败则按retry_delay退避重排连续失败触发项目级熔断暂停理解了这套优先级队列 指数退避重试 令牌桶限速的组合拳你就不再是只会写self.crawl的脚本选手而是能调优整个爬虫系统节奏的工程师。接下来可以阅读 docs/About-Tasks.md 了解任务状态的完整生命周期或在 WebUI 中点击 Active Tasks 按钮实时观察任务如何在队列中流转。【免费下载链接】pyspiderA Powerful Spider(Web Crawler) System in Python.项目地址: https://gitcode.com/gh_mirrors/py/pyspider创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考