Python寫爬蟲用到什麼函式庫
Python爬蟲,全名為Python網路爬蟲,是一種依照一定的規則,自動抓取萬維網資訊的程式或腳本,主要用於抓取證券交易資料、天氣數據、網站用戶資料和圖片資料等,Python為支援網路爬蟲正常功能實現,內建了大量的庫,主要有幾種類型。下面本篇文章就來跟大家介紹。
一、Python爬蟲網庫
Python爬蟲網庫主要包括:urllib、requests、grab、pycurl、urllib3、httplib2、RoboBrowser、MechanicalSoup、mechanize、socket、Unirest for Python、hyper 、PySocks、treq以及aiohttp等。
二、Python網路爬蟲框架
Python網路爬蟲框架主要包括:grab、scrapy、pyspider、cola、portia、restkit以及demiurge等。
三、HTML/XML解析器
● lxml:C語言編寫高效能HTML/ XML處理庫。支援XPath。
● cssselect:解析DOM樹和CSS選擇器。
● pyquery:解析DOM樹和jQuery選擇器。
● BeautifulSoup:低效HTML/ XML處理庫,純Python實作。
● html5lib:根據WHATWG規範產生HTML/ XML文檔的DOM。這個規範被用在現在所有的瀏覽器上。
● feedparser:解析RSS/ATOM feeds。
● MarkupSafe:為XML/HTML/XHTML提供了安全轉義的字串。
● xmltodict:一個可以讓你在處理XML時感覺像在處理JSON一樣的Python模組。
● xhtml2pdf:將HTML/CSS轉換為PDF。
● untangle:輕鬆實現將XML檔案轉換為Python物件。
四、文字處理
用於解析、操作簡單文字的函式庫。
● difflib:(Python標準函式庫)幫助進行差異化比較。
● Levenshtein:快速計算Levenshtein距離和字串相似度。
● fuzzywuzzy:模糊字串匹配。
● esmre:正規表示式加速器。
● ftfy:自動整理Unicode文本,減少碎片化。
五、特定格式檔案處理
解析和處理特定文字格式的函式庫。
● tablib:一個把資料匯出為XLS、CSV、JSON、YAML等格式的模組。
● textract:從各種文件中提取文本,例如 Word、PowerPoint、PDF等。
● messytables:解析混亂的表格資料的工具。
● rows:一個常用資料接口,支援的格式很多(目前支援CSV,HTML,XLS,TXT:將來還會提供更多!)。
以上是Python寫爬蟲用到什麼函式庫的詳細內容。更多資訊請關注PHP中文網其他相關文章!

熱AI工具

Undresser.AI Undress
人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover
用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool
免費脫衣圖片

Clothoff.io
AI脫衣器

AI Hentai Generator
免費產生 AI 無盡。

熱門文章

熱工具

記事本++7.3.1
好用且免費的程式碼編輯器

SublimeText3漢化版
中文版,非常好用

禪工作室 13.0.1
強大的PHP整合開發環境

Dreamweaver CS6
視覺化網頁開發工具

SublimeText3 Mac版
神級程式碼編輯軟體(SublimeText3)

熱門話題

Linux終端中查看Python版本時遇到權限問題的解決方法當你在Linux終端中嘗試查看Python的版本時,輸入python...

在使用Python的pandas庫時,如何在兩個結構不同的DataFrame之間進行整列複製是一個常見的問題。假設我們有兩個Dat...

本文討論了諸如Numpy,Pandas,Matplotlib,Scikit-Learn,Tensorflow,Tensorflow,Django,Blask和請求等流行的Python庫,並詳細介紹了它們在科學計算,數據分析,可視化,機器學習,網絡開發和H中的用途

Uvicorn是如何持續監聽HTTP請求的? Uvicorn是一個基於ASGI的輕量級Web服務器,其核心功能之一便是監聽HTTP請求並進�...

文章討論了虛擬環境在Python中的作用,重點是管理項目依賴性並避免衝突。它詳細介紹了他們在改善項目管理和減少依賴問題方面的創建,激活和利益。

在Python中,如何通過字符串動態創建對象並調用其方法?這是一個常見的編程需求,尤其在需要根據配置或運行...
