在Python中使用cookielib和urlib2配合PyQuery抓取网页信息-Python教程-PHP中文网

首页

后端开发

Python教程

在Python中使用cookielib和urlib2配合PyQuery抓取网页信息

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 06, 2016 am 11:26 AM

python

刚才好无聊，突然想起来之前做一个课表的点子，于是百度了起来。

刚开始，我是这样想的：在写微信墙的时候，用到了urllib2【两行代码抓网页】，那么就只剩下解析html了。于是百度：python解析html。发现一篇好文章，其中介绍到了pyQuery。

pyQuery 是 jQuery 在 Python 中的实现，能够以 jQuery 的语法來操作解析 HTML 文档。使用前需要安装，Mac安装方法如下：

sudo easy_install pyquery

登录后复制

OK！安装好了！

我们来试一试吧：

from pyquery import PyQuery as pq
html = pq(url=u'http://seam.ustb.edu.cn:8080/jwgl/index.jsp')
#现在已经获取了本科教学网首页的html
classes = html('.haveclass')
#通过类名获取元素
#如果你对jQuery熟悉的话，那么你现在肯定明白pyQuery的方便了
更多用法参见pyQuery API

登录后复制

好像学会了使用pyQuery就能抓课表了呢，但是，如果你直接用我的源码，肯定会出错。因为还没有登录啊！

所以，在运行这一行抓取正确的代码之前，我们需要模拟登录本科教学网。这个时候，我想起来urllib有模拟post请求的函数，于是我百度了：urllib post。

这是一个最简的模拟post请求例子：

import urllib
import urllib2
import cookielib

cj = cookielib.CookieJar()
opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(cj))
opener.addheaders = [('User-agent','Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1)')]
urllib2.install_opener(opener)
req = urllib2.Request("http://seam.ustb.edu.cn:8080/jwgl/Login",urllib.urlencode({"username":"41255029","password":"123456","usertype":"student"}))
req.add_header("Referer","http://xxoo.com")
resp = urllib2.urlopen(req)
#这里面用到了cookielib，我不太清楚，以后慢慢了解吧
#还用到了urllib和urllib2，urllib2大概是urllib的扩展包【233想到了三国杀

登录后复制

在这个最简的实例里，用我的校园网账号向登录页面提交表单数据，模拟登录。

现在，我们已经登录了本科教学网，然后结合之前的pyQuery解析html就可以获取网页内的课表了。

html = pq(url=u'http://seam.ustb.edu.cn:8080/jwgl/index.jsp')
self.render("index.html",data=html('.haveclass'))

登录后复制

结果展示如图：

最后：

我发现，pyQuery不但用于解析html非常方便，而且可以作为跨域抓取数据的工具，NICE!!!

希望对大家有帮助。

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

免费脱衣服图片

Clothoff.io

AI脱衣机

AI Hentai Generator

免费生成ai无尽的。

显示更多

热工具

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

中文版，非常好用

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

显示更多

热门话题

gmail邮箱登陆入口在哪里

7403

Java教程

1630

CakePHP 教程

1358

Laravel 教程

1268

PHP教程

1218

显示更多

Related knowledge

手机XML转PDF，转换速度快吗？ Apr 02, 2025 pm 10:09 PM

手机XML转PDF的速度取决于以下因素：XML结构的复杂性手机硬件配置转换方法（库、算法）代码质量优化手段（选择高效库、优化算法、缓存数据、利用多线程）总体而言，没有绝对的答案，需要根据具体情况进行优化。

怎么在手机上把XML文件转换为PDF？ Apr 02, 2025 pm 10:12 PM

不可能直接在手机上用单一应用完成 XML 到 PDF 的转换。需要使用云端服务，通过两步走的方式实现：1. 在云端转换 XML 为 PDF，2. 在手机端访问或下载转换后的 PDF 文件。

C语言 sum 的作用是什么？ Apr 03, 2025 pm 02:21 PM

C语言中没有内置求和函数，需自行编写。可通过遍历数组并累加元素实现求和：循环版本：使用for循环和数组长度计算求和。指针版本：使用指针指向数组元素，通过自增指针遍历高效求和。动态分配数组版本：动态分配数组并自行管理内存，确保释放已分配内存以防止内存泄漏。

有没有手机APP可以将XML转换成PDF？ Apr 02, 2025 pm 09:45 PM

没有APP可以将所有XML文件转成PDF，因为XML结构灵活多样。XML转PDF的核心是将数据结构转换为页面布局，需要解析XML并生成PDF。常用的方法包括使用Python库（如ElementTree）解析XML，并利用ReportLab库生成PDF。对于复杂XML，可能需要使用XSLT转换结构。性能优化时，考虑使用多线程或多进程，并选择合适的库。

xml怎么转换成图片 Apr 03, 2025 am 07:39 AM

可以将 XML 转换为图像，方法是使用 XSLT 转换器或图像库。XSLT 转换器：使用 XSLT 处理器和样式表，将 XML 转换为图像。图像库：使用 PIL 或 ImageMagick 等库，从 XML 数据创建图像，例如绘制形状和文本。

xml格式化工具推荐 Apr 02, 2025 pm 09:03 PM

XML格式化工具可以将代码按照规则排版，提高可读性和理解性。选择工具时，要注意自定义能力、对特殊情况的处理、性能和易用性。常用的工具类型包括在线工具、IDE插件和命令行工具。

如何在手机上高质量地将XML转换成PDF？ Apr 02, 2025 pm 09:48 PM

在手机上高质量地将XML转换成PDF需要：使用无服务器计算平台在云端解析XML并生成PDF。选择高效的XML解析器和PDF生成库。正确处理错误。充分利用云端计算能力，避免在手机上进行繁重任务。根据需求调整复杂度，包括处理复杂的XML结构、生成多页PDF和添加图片。打印日志信息以帮助调试。优化性能，选择高效的解析器和PDF库，并可能使用异步编程或预处理XML数据。确保良好的代码质量和可维护性。