首頁 > 後端開發 > Python教學 > python爬蟲什麼意思

python爬蟲什麼意思

silencement
發布: 2020-09-14 15:29:21
原創
51403 人瀏覽過

python爬蟲指的是Python網絡爬蟲,又被稱為網頁蜘蛛,網絡機器人,是一種按照一定的規則,自動地抓取萬維網信息的程序或者腳本,另外一些不常使用的名字還有螞蟻、自動索引、模擬程式或蠕蟲。

python爬蟲什麼意思

簡單來說互聯網是由一個個站點和網絡設備組成的大網,我們透過瀏覽器訪問站點,站點把HTML、JS、CSS代碼回傳給瀏覽器,這些程式碼經過瀏覽器解析、渲染,將豐富多彩的網頁呈現我們眼前

python爬蟲什麼意思

#如果我們把網路比喻為一張大的蜘蛛網,資料便是存放於蜘蛛網的各個節點,而Python爬蟲就是一隻小蜘蛛,

沿著網絡抓取自己的獵物(資料)爬蟲指的是:向網站發起請求,獲取資源後分析並提取有用資料的程式;

從技術層面來說就是透過程式模擬瀏覽器請求網站的行為,把網站傳回的HTML程式碼/JSON資料/二進位資料(圖片、影片) 爬到本地,進而提取自己需要的數據,存放起來使用

Python爬蟲的基本原理

python爬蟲什麼意思

1、發起請求

使用http函式庫向目標網站發起請求,也就是傳送一個Request

Request包含:請求頭、請求體等 

Request模組缺陷:不能執行JS 和CSS 程式碼

 2、取得回應內容

如果伺服器能正常回應,則會得到一個Response

Response包含:html,json,圖片,影片等

# 3.解析內容

解析html資料:正規表示式(RE模組),第三方解析庫如Beautifulsoup,pyquery等

解析json資料:json模組

#解析二進位資料:以wb的方式寫入檔案

 4、儲存資料

#資料庫(MySQL,Mongdb、Redis)

以上是python爬蟲什麼意思的詳細內容。更多資訊請關注PHP中文網其他相關文章!

相關標籤:
來源:php.cn
本網站聲明
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn
作者最新文章
熱門教學
更多>
最新下載
更多>
網站特效
網站源碼
網站素材
前端模板