python之调度器的用法-Python教程-PHP中文网

首页

后端开发

Python教程

python之调度器的用法

零下一度

Jun 25, 2017 am 10:15 AM

python 思考爬虫解决问题

　　继续上一篇文章的内容，上一篇文章中，将爬虫调度器已经写好了，调度器是整个爬虫程序的“大脑”，也可以称之为指挥中心。而现在，我们要做的就是去将调度器中用到的其他组件写好。首先是url管理器，它既然作为管理器，那么它一定要区分待爬取的url和已经爬取的url，否则会重复爬取。这里教程用的是set集合，将两个url暂时存放到集合中，也就是内存中，毕竟比较爬取的数据比较少，当然也可以存放到别的地方，比如缓存或者关系型数据库中。　

　　　　第一次是调度器初始化函数中，创建这个urlmanager对象，

　　　　第二次是调用了add_new_url方法来将最初始的url加入到带爬取的集合中，

　　　　第三次是在爬取过程中来判断是否有待爬取的url,

　　　　第四次是将要爬取的url从集合中取出来，

　　　　第五次是将页面解析出来的新的一组url再次添加到带爬去集合中

　　那么我们接下来就要做的是用代码来实现这些功能：

 1 class UrlManager(object): 2     """docstring for UrlManager""" 3     def __init__(self): 4         self.new_urls = set() 5         self.old_urls = set() 6     #向管理器中添加一个新的url 7     def add_new_url(self,url): 8         if url is None: 9             return10         if url not in self.new_urls and url not in self.old_urls:11             self.new_urls.add(url)12     #从爬取数据中向管理器中批量添加url13     def add_new_urls(self,urls):14         if urls is None or len(urls) == 0:15             return16         for url in urls:17             self.add_new_url(url)18     #判断是否有新的url19     def has_new_url(self):20         return (len(self.new_urls) != 0)21     #从管理器中取出一个新的url22     def get_new_url(self):23         new_url = self.new_urls.pop()24         self.old_urls.add(new_url)25         return new_url

登录后复制

　　好，到这，url管理器就搞定了！

　　接下来就是url下载器了，很简单一个功能，将程序访问的页面保存下来。

　下载器只在调度器中出现过两次：

　　　　第一次是初始化的时候创建

　　　　第二次是紧接着取到url之后，马上调用它来下载页面

　　在url下载器中，原教程使用的是urllib库，我觉得有点繁琐。所以我换成了一个更好用的库：requests。这个库可以帮助我屏蔽许多技术难题，直接去抓取我们想要访问的页面，而且使用起来非常简单。

 1 import requests 2  3 class HtmlDownloader(object): 4     """docstring for HtmlDownloader"""     5     def download(self,url): 6         if url is None: 7             return  8         response = requests.get(url, timeout = 0.1) 9         response.encoding = 'utf-8'10         if response.status_code == requests.codes.ok:11             return response.text12         else:13             return

登录后复制

　　简要讲一下这段代码：

　　　　a.首先要导入requests库，这个因为是第三方库，所以需要你自己下载，在命令行输入：pip install requests

　　　　b.然后开始写下载器这个类，这个类只有一个方法，就是download。这个方法首先会接受你给定的url，然后对其进行判断是否存在。

　　　　c.然后调用requests的get方法，它里面接受两个参数，一个是url,还有一个是timeout

　　　　　　timeout是我自己额外加进去的，就是访问超时。如果不加timeout，程序会假死，也就是说会一直在那里等待页面的响应，也不抛出异常。

　　　　d.然后对返回的response进行编码设置，因为爬取的百度百科页面是utf-8，所以这里最好还是设置一下，虽然requests会智能判断，但是还是手动改一下为宜。

　　　　e.然后在判断页面是否响应，这里的codes.ok其实就是200，表示网页正常响应，你这里直接写 response.status_code == 200 也没问题。

　　　　f.最后，将页面的所有内容都返回，这里的text就是一个字符串，它包含了一个页面的所有代码（html,css,js）。

以上是python之调度器的用法的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

免费脱衣服图片

Clothoff.io

AI脱衣机

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸！

显示更多

热工具

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

中文版，非常好用

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

显示更多

热门话题

gmail邮箱登陆入口在哪里

7662

CakePHP 教程

1393

C# 教程

1205

steam的账户名称是什么格式

win11激活密钥永久

显示更多

Related knowledge

PHP和Python：解释了不同的范例 Apr 18, 2025 am 12:26 AM

PHP主要是过程式编程，但也支持面向对象编程（OOP）；Python支持多种范式，包括OOP、函数式和过程式编程。PHP适合web开发，Python适用于多种应用，如数据分析和机器学习。

在PHP和Python之间进行选择：指南 Apr 18, 2025 am 12:24 AM

PHP适合网页开发和快速原型开发，Python适用于数据科学和机器学习。1.PHP用于动态网页开发，语法简单，适合快速开发。2.Python语法简洁，适用于多领域，库生态系统强大。

visual studio code 可以用于 python 吗 Apr 15, 2025 pm 08:18 PM

VS Code 可用于编写 Python，并提供许多功能，使其成为开发 Python 应用程序的理想工具。它允许用户：安装 Python 扩展，以获得代码补全、语法高亮和调试等功能。使用调试器逐步跟踪代码，查找和修复错误。集成 Git，进行版本控制。使用代码格式化工具，保持代码一致性。使用 Linting 工具，提前发现潜在问题。

vs code 可以在 Windows 8 中运行吗 Apr 15, 2025 pm 07:24 PM

VS Code可以在Windows 8上运行，但体验可能不佳。首先确保系统已更新到最新补丁，然后下载与系统架构匹配的VS Code安装包，按照提示安装。安装后，注意某些扩展程序可能与Windows 8不兼容，需要寻找替代扩展或在虚拟机中使用更新的Windows系统。安装必要的扩展，检查是否正常工作。尽管VS Code在Windows 8上可行，但建议升级到更新的Windows系统以获得更好的开发体验和安全保障。