masyarakat

Belajar

Perpustakaan Alatan

Alat AI

Masa lapang

Melayu

Rumah > pembangunan bahagian belakang > Tutorial Python > Python写爬虫都用到什么库

Python写爬虫都用到什么库

silencement

Lepaskan： 2019-06-21 15:34:32

asal

7431 orang telah melayarinya

Python写爬虫都用到什么库

Python爬虫，全称Python网络爬虫，是一种按照一定的规则，自动地抓取万维网信息的程序或脚本，主要用于抓取证券交易数据、天气数据、网站用户数据和图片数据等，Python为支持网络爬虫正常功能实现，内置了大量的库，主要有几种类型。下面本篇文章就来给大家介绍。

一、Python爬虫网络库

Python爬虫网络库主要包括：urllib、requests、grab、pycurl、urllib3、httplib2、RoboBrowser、MechanicalSoup、mechanize、socket、Unirest for Python、hyper、PySocks、treq以及aiohttp等。

二、Python网络爬虫框架

Python网络爬虫框架主要包括：grab、scrapy、pyspider、cola、portia、restkit以及demiurge等。

三、HTML/XML解析器

●　lxml：C语言编写高效HTML/ XML处理库。支持XPath。

●　cssselect：解析DOM树和CSS选择器。

●　pyquery：解析DOM树和jQuery选择器。

●　BeautifulSoup：低效HTML/ XML处理库，纯Python实现。

●　html5lib：根据WHATWG规范生成HTML/ XML文档的DOM。该规范被用在现在所有的浏览器上。

●　feedparser：解析RSS/ATOM feeds。

●　MarkupSafe：为XML/HTML/XHTML提供了安全转义的字符串。

●　xmltodict：一个可以让你在处理XML时感觉像在处理JSON一样的Python模块。

●　xhtml2pdf：将HTML/CSS转换为PDF。

●　untangle：轻松实现将XML文件转换为Python对象。

四、文本处理

用于解析和操作简单文本的库。

●　difflib：（Python标准库）帮助进行差异化比较。

●　Levenshtein：快速计算Levenshtein距离和字符串相似度。

●　fuzzywuzzy：模糊字符串匹配。

●　esmre：正则表达式加速器。

●　ftfy：自动整理Unicode文本，减少碎片化。

五、特定格式文件处理

解析和处理特定文本格式的库。

●　tablib：一个把数据导出为XLS、CSV、JSON、YAML等格式的模块。

●　textract：从各种文件中提取文本，比如 Word、PowerPoint、PDF等。

●　messytables：解析混乱的表格数据的工具。

●　rows：一个常用数据接口，支持的格式很多（目前支持CSV，HTML，XLS，TXT：将来还会提供更多！）。

Atas ialah kandungan terperinci Python写爬虫都用到什么库. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Label berkaitan：

perpustakaan crawler python

Artikel sebelumnya：python和爬虫有什么关系 Artikel seterusnya：python里d是什么意思

Kenyataan Laman Web ini

Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Artikel terbaru oleh pengarang

如何设置cookie和删除cookie

2020-02-27 16:50:07
ThinkPHP5中的事务操作

2020-01-30 22:49:41
ThinkPHP5.1中使用redis缓存

2020-01-30 22:43:08
php中常用的正则表达式使用方法

2023-04-08 11:32:02
PHP中Trait的用法及示例

2023-04-08 11:24:01
PHP中的global关键字用法

2023-04-08 11:00:01
PHP中字符串处理的一些常用函数

2023-04-08 10:56:02
mysql正则匹配模糊查询某个字段

2023-04-08 10:54:02
PHP7.4新特性汇总

2023-04-08 10:36:01
TP6验证码验证失败的原因以及解决办法

2023-04-08 10:34:01

Isu terkini

javascript - Sila beritahu saya tentang masalah menukar fungsi panggil balik jq untuk menjanjikan pelaksanaan

daripada 1970-01-01 08:00:00

0

0

0

javascript - Kekeliruan tentang menghantar parameter dalam tindak balas

daripada 1970-01-01 08:00:00

0

0

0

javascript - gambar rajah tindanan atribut js

daripada 1970-01-01 08:00:00

0

0

0

javascript - aplikasi halaman tunggal angularjs Bagaimana untuk menyelesaikan masalah tidak menatal ke bahagian atas halaman selepas halaman menatal ke bawah dan navigasi melompat ke halaman baharu?

daripada 1970-01-01 08:00:00

0

0

0

javascript - Apabila membina projek dengan vue-cli, anda perlu memperkenalkan fail js dan CSS statik tempatan Bagaimana untuk membungkusnya?

daripada 1970-01-01 08:00:00

0

0

0

Topik-topik yang berkaitan

Lagi>

Cadangan popular

Tutorial Popular

Lagi>

Tutorial berkaitan

Cadangan popular

Kursus terkini

Tutorial Video Rangka Kerja Web Python Bermula

24751
tutorial python Tutorial video Django

48136

Muat turun terkini

Lagi>

kesan web

Kod sumber laman web

Bahan laman web

Templat hujung hadapan