python爬蟲是指基於Python開發的爬蟲,而網路爬蟲是一種按照一定的規則,自動地抓取萬維網資訊的程式或腳本;使用者可以用爬蟲爬圖片,爬取影片等一些想要爬取的數據,只要能透過瀏覽器存取的數據都可以透過爬蟲取得。
本文操作環境:linux5.9.8系統、Dell G3電腦、python3.6.4。
世界上80%的爬蟲是基於Python開發的,學好爬蟲技能,可為後續的大數據分析、挖掘、機器學習等提供重要的資料來源。你可以用爬蟲爬圖片,爬取影片等等你想要爬取的數據,只要你能透過瀏覽器存取的數據都可以透過爬蟲取得。
什麼是爬蟲?
網路爬蟲(又被稱為網頁蜘蛛,網路機器人,在FOAF社群中間,更經常的稱為網頁追逐者),是一種按照一定的規則,自動地抓取萬維網訊息的程式或腳本。另外一些不常使用的名字還有螞蟻、自動索引、模擬程式或蠕蟲。
其實通俗的講就是透過程式去取得web頁面上自己想要的數據,也就是自動抓取數據。
爬蟲的本質是什麼?
模擬瀏覽器開啟網頁,取得網頁中我們想要的那部分資料
#瀏覽器開啟網頁的過程:
當你在瀏覽器中輸入位址後,經過DNS伺服器找到伺服器主機,向伺服器傳送一個請求,伺服器經過解析後傳送給使用者瀏覽器結果,包括html,js,css等檔案內容,瀏覽器解析出來最後呈現給使用者在瀏覽器上看到的結果
所以使用者看到的瀏覽器的結果就是由HTML程式碼構成的,我們爬蟲就是為了取得這些內容,透過分析和過濾html程式碼,從中取得我們想要資源。
【推薦閱讀:Python影片教學】
以上是python爬蟲是做什麼的的詳細內容。更多資訊請關注PHP中文網其他相關文章!