Python 製作糗事百科爬蟲-Python教學-PHP中文網

首頁

後端開發

Python教學

Python 製作糗事百科爬蟲

高洛峰

Feb 24, 2017 pm 04:07 PM

早上起來閒來無事做，莫名其妙的就彈出了糗事百科的段子，轉念一想既然你送上門來，那我就寫個爬蟲到你網站上爬一爬吧，一來當做練練手，二來也算找點樂子。

其實這兩天也正在接觸資料庫的內容，可以將爬取下來的資料保存在資料庫中，以待以後的利用。好了，廢話不多說了，先來看看程式爬取的資料結果

Python 制作糗事百科爬虫

#值得一提的是，我在程式中想一下子爬取糗事百科30 頁的內容，但是出現了連接錯誤，當我把頁數降到20 頁的時候，程序就可以正常的跑起來了，不知道是什麼原因，渴望知道的大神可以告訴我一聲，感激不盡。

程式非常簡單，直接上原始碼咯

# coding=utf8

import re
import requests
from lxml import etree
from multiprocessing.dummy import Pool as ThreadPool
import sys

reload(sys)
sys.setdefaultencoding(&#39;utf-8&#39;)


def getnewpage(url, total):
 nowpage = int(re.search(&#39;(\d+)&#39;, url, re.S).group(1))
 urls = []

 for i in range(nowpage, total + 1):
  link = re.sub(&#39;(\d+)&#39;, &#39;%s&#39; % i, url, re.S)
  urls.append(link)

 return urls


def spider(url):
 html = requests.get(url)
 selector = etree.HTML(html.text)

 author = selector.xpath(&#39;//*[@id="content-left"]/p/p[1]/a[2]/@title&#39;)
 content = selector.xpath(&#39;//*[@id="content-left"]/p/p[2]/text()&#39;)
 vote = selector.xpath(&#39;//*[@id="content-left"]/p/p[3]/span/i/text()&#39;)

 length = len(author)
 for i in range(0, length):
  f.writelines(&#39;作者 : &#39; + author[i] + &#39;\n&#39;)
  f.writelines(&#39;内容 ：&#39; + str(content[i]).replace(&#39;\n&#39;,&#39;&#39;) + &#39;\n&#39;)
  f.writelines(&#39;支持 ： &#39; + vote[i] + &#39;\n\n&#39;)


if __name__ == &#39;__main__&#39;:

 f = open(&#39;info.txt&#39;, &#39;a&#39;)
 url = &#39;http://www.qiushibaike.com/text/page/1/&#39;
 urls = getnewpage(url, 20)

 pool = ThreadPool(4)
 pool.map(spider,urls)
 f.close()

登入後複製

如果其中有不懂得部分，可以依序參考我的前三篇文章。

更多Python 製作糗事百科爬蟲相關文章請追蹤PHP中文網！

本網站聲明

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

熱AI工具

熱工具

熱門話題

Java教學

1665

CakePHP 教程

1424

Laravel 教程

1321

PHP教程

1269

C# 教程

1249

Related knowledge

Python vs.C：申請和用例 Apr 12, 2025 am 12:01 AM

Python适合数据科学、Web开发和自动化任务，而C 适用于系统编程、游戏开发和嵌入式系统。Python以简洁和强大的生态系统著称，C 则以高性能和底层控制能力闻名。

Python：遊戲，Guis等 Apr 13, 2025 am 12:14 AM

Python在遊戲和GUI開發中表現出色。 1)遊戲開發使用Pygame，提供繪圖、音頻等功能，適合創建2D遊戲。 2)GUI開發可選擇Tkinter或PyQt，Tkinter簡單易用，PyQt功能豐富，適合專業開發。

Python與C：學習曲線和易用性 Apr 19, 2025 am 12:20 AM

Python更易學且易用，C 則更強大但複雜。 1.Python語法簡潔，適合初學者，動態類型和自動內存管理使其易用，但可能導致運行時錯誤。 2.C 提供低級控制和高級特性，適合高性能應用，但學習門檻高，需手動管理內存和類型安全。

Python和時間：充分利用您的學習時間 Apr 14, 2025 am 12:02 AM

要在有限的時間內最大化學習Python的效率，可以使用Python的datetime、time和schedule模塊。 1.datetime模塊用於記錄和規劃學習時間。 2.time模塊幫助設置學習和休息時間。 3.schedule模塊自動化安排每週學習任務。

Python vs.C：探索性能和效率 Apr 18, 2025 am 12:20 AM

Python在開發效率上優於C ，但C 在執行性能上更高。 1.Python的簡潔語法和豐富庫提高開發效率。 2.C 的編譯型特性和硬件控制提升執行性能。選擇時需根據項目需求權衡開發速度與執行效率。

Python：自動化，腳本和任務管理 Apr 16, 2025 am 12:14 AM

Python在自動化、腳本編寫和任務管理中表現出色。 1)自動化：通過標準庫如os、shutil實現文件備份。 2)腳本編寫：使用psutil庫監控系統資源。 3)任務管理：利用schedule庫調度任務。 Python的易用性和豐富庫支持使其在這些領域中成為首選工具。

Python標準庫的哪一部分是：列表或數組？ Apr 27, 2025 am 12:03 AM

pythonlistsarepartofthestAndArdLibrary，herilearRaysarenot.listsarebuilt-In，多功能，和Rused ForStoringCollections，而EasaraySaraySaraySaraysaraySaraySaraysaraySaraysarrayModuleandleandleandlesscommonlyusedDduetolimitedFunctionalityFunctionalityFunctionality。