python爬蟲：隨心所欲地爬取百度圖片-Python教學-PHP中文網

首頁

後端開發

Python教學

python爬蟲：隨心所欲地爬取百度圖片

coldplay.xixi

Mar 05, 2021 am 10:04 AM

python

python爬蟲：隨心所欲地爬取百度圖片

文章目錄

- #一、前言
- 二、需要導入的函式庫
- 三、實作過程
- - - 1、下載連結分析
    - 2、程式碼分析
    - #3 、完整程式碼
- 四、Blogger's speech

(免費學習推薦：python影片教學)

#一、前言

##之前爬取了很多靜態網頁的內容，包括：小說、圖片等等，今天我來嘗試動態網頁的爬取。眾所周知，百度圖片就是一個動態網頁。那麼，衝！衝！！衝！！！

二、需要匯入的函式庫

import requestsimport jsonimport os

登入後複製

三、實作過程

1、下載連結分析

首先，打開百度，搜尋一個內容，這裡搜尋的是男神（

本人）－彭于晏
python爬蟲：隨心所欲地爬取百度圖片然後，打開抓包工具，選擇
XHR選項，按Ctrl R，然後你會發現，隨著你滑鼠的滑動，右側會出現一個又一個的資料包。

（這裡沒滑太多，一開始因為滑動太多，錄製的GIF超5M了）

然後，選一個包，查看它的headers，如圖：

python爬蟲：隨心所欲地爬取百度圖片

截取之後，貼在記事本上，作為一個URL，後文會用到。

python爬蟲：隨心所欲地爬取百度圖片這裡有很多很多的參數，我也不知道具體哪些是可以忽略的，後文就索性全複製下來了，具體看後文。

到這裡，能夠直接觀察到的內容就結束了，接下來，借助程式碼，幫我們打開另一個世界的大門

衝就完事了！

2、程式碼分析

首先：把上述中的「

其它參數」組在一起。

自己做的話，最好複製自己的「

其它參數」。在

之後，我們可以先提取一下試試，並且把編碼格式改成

'utf-8'

 url = 'https://image.baidu.com/search/acjson?'
    param = {
        'tn': 'resultjson_com',
        'logid': ' 7517080705015306512',
        'ipn': 'rj',
        'ct': '201326592',
        'is': '',
        'fp': 'result',
        'queryWord': '彭于晏',
        'cl': '2',
        'lm': '-1',
        'ie': 'utf-8',
        'oe': 'utf-8',
        'adpicid': '',
        'st': '',
        'z': '',
        'ic': '',
        'hd': '',
        'latest': '',
        'copyright': '',
        'word': '彭于晏',
        's': '',
        'se': '',
        'tab': '',
        'width': '',
        'height': '',
        'face': '',
        'istype': '',
        'qc': '',
        'nc': '1',
        'fr': '',
        'expermode': '',
        'force': '',
        'cg': 'star',
        'pn': '30',
        'rn': '30',
        'gsm': '1e',
    }
    # 将编码形式转换为utf-8
    response = requests.get(url=url, headers=header, params=param)
    response.encoding = 'utf-8'
    response = response.text    print(response)

登入後複製

運行結果如下：

python爬蟲：隨心所欲地爬取百度圖片看上去挺亂的哈，沒事，我們給包裝一下！

在上面的基礎上加上：

 # 把字符串转换成json数据
    data_s = json.loads(response)
    print(data_s)

登入後複製

運行結果如下：

python爬蟲：隨心所欲地爬取百度圖片和上面相比，已經明晰很多了，但依舊不夠明確，為什麼呢？因為它印刷的格式不方便我們觀看！

對此，有兩種解決辦法。

①導入

pprint庫，接著輸入pprint.pprint(data_s)，就能列印啦，如下圖

python爬蟲：隨心所欲地爬取百度圖片

#②使用json線上解析器（自行百度），結果如下： python爬蟲：隨心所欲地爬取百度圖片

解決掉上一步，我們會發現，想要的資料都在data裡面！

那就提取吧！

 a = data_s["data"]
    for i in range(len(a)-1):  # -1是为了去掉上面那个空数据
        data = a[i].get("thumbURL", "not exist")
        print(data)

登入後複製

結果如下：

到這裡，已經成功90％啦，剩下的就是儲存和最佳化程式碼了！

3、完整程式碼######這部分和上面有些許不同，仔細看看就會發現嗷！ ###

# -*- coding: UTF-8 -*-"""
@Author  ：远方的星
@Time   : 2021/2/27 17:49
@CSDN    ：https://blog.csdn.net/qq_44921056
@腾讯云   ： https://cloud.tencent.com/developer/user/8320044
"""import requestsimport jsonimport osimport pprint# 创建一个文件夹path = 'D:/百度图片'if not os.path.exists(path):
    os.mkdir(path)# 导入一个请求头header = {
    'User-Agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 11_1_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/87.0.4280.88 Safari/537.36'}# 用户（自己）输入信息指令keyword = input('请输入你想下载的内容：')page = input('请输入你想爬取的页数：')page = int(page) + 1n = 0pn = 1# pn代表从第几张图片开始获取，百度图片下滑时默认一次性显示30张for m in range(1, page):
    url = 'https://image.baidu.com/search/acjson?'
    param = {
        'tn': 'resultjson_com',
        'logid': ' 7517080705015306512',
        'ipn': 'rj',
        'ct': '201326592',
        'is': '',
        'fp': 'result',
        'queryWord': keyword,
        'cl': '2',
        'lm': '-1',
        'ie': 'utf-8',
        'oe': 'utf-8',
        'adpicid': '',
        'st': '',
        'z': '',
        'ic': '',
        'hd': '',
        'latest': '',
        'copyright': '',
        'word': keyword,
        's': '',
        'se': '',
        'tab': '',
        'width': '',
        'height': '',
        'face': '',
        'istype': '',
        'qc': '',
        'nc': '1',
        'fr': '',
        'expermode': '',
        'force': '',
        'cg': 'star',
        'pn': pn,
        'rn': '30',
        'gsm': '1e',
    }
    # 定义一个空列表，用于存放图片的URL
    image_url = list()
    # 将编码形式转换为utf-8
    response = requests.get(url=url, headers=header, params=param)
    response.encoding = 'utf-8'
    response = response.text    # 把字符串转换成json数据
    data_s = json.loads(response)
    a = data_s["data"]  # 提取data里的数据
    for i in range(len(a)-1):  # 去掉最后一个空数据
        data = a[i].get("thumbURL", "not exist")  # 防止报错key error
        image_url.append(data)

    for image_src in image_url:
        image_data = requests.get(url=image_src, headers=header).content  # 提取图片内容数据
        image_name = '{}'.format(n+1) + '.jpg'  # 图片名
        image_path = path + '/' + image_name  # 图片保存路径
        with open(image_path, 'wb') as f:  # 保存数据
            f.write(image_data)
            print(image_name, '下载成功啦！！！')
            f.close()
        n += 1
    pn += 29

登入後複製

###運行結果如下：##################朋友提示###：### ①：一頁是30張### ②：輸入的內容可以很多變：例如橋、月亮、太陽、胡歌、趙麗穎等等。 #########四、Blogger’s speech#########希望大家可以，按讚、追蹤、收藏，三連支持一下！ ###

大量免費學習推薦，請造訪python教學(影片)

以上是python爬蟲：隨心所欲地爬取百度圖片的詳細內容。更多資訊請關注PHP中文網其他相關文章！

本網站聲明

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

熱AI工具

Undresser.AI Undress

人工智慧驅動的應用程序，用於創建逼真的裸體照片

AI Clothes Remover

用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool

免費脫衣圖片

Clothoff.io

AI脫衣器

Video Face Swap

使用我們完全免費的人工智慧換臉工具，輕鬆在任何影片中換臉！

熱工具

記事本++7.3.1

好用且免費的程式碼編輯器

SublimeText3漢化版

中文版，非常好用

禪工作室 13.0.1

強大的PHP整合開發環境

Dreamweaver CS6

視覺化網頁開發工具

SublimeText3 Mac版

神級程式碼編輯軟體(SublimeText3)

熱門話題

Java教學

1666

CakePHP 教程

1425

Laravel 教程

1323

PHP教程

1272

C# 教程

1251

Related knowledge

PHP和Python：解釋了不同的範例 Apr 18, 2025 am 12:26 AM

PHP主要是過程式編程，但也支持面向對象編程（OOP）；Python支持多種範式，包括OOP、函數式和過程式編程。 PHP適合web開發，Python適用於多種應用，如數據分析和機器學習。

在PHP和Python之間進行選擇：指南 Apr 18, 2025 am 12:24 AM

PHP適合網頁開發和快速原型開發，Python適用於數據科學和機器學習。 1.PHP用於動態網頁開發，語法簡單，適合快速開發。 2.Python語法簡潔，適用於多領域，庫生態系統強大。

sublime怎麼運行代碼python Apr 16, 2025 am 08:48 AM

在 Sublime Text 中運行 Python 代碼，需先安裝 Python 插件，再創建 .py 文件並編寫代碼，最後按 Ctrl B 運行代碼，輸出會在控制台中顯示。

Python vs. JavaScript：學習曲線和易用性 Apr 16, 2025 am 12:12 AM

Python更適合初學者，學習曲線平緩，語法簡潔；JavaScript適合前端開發，學習曲線較陡，語法靈活。 1.Python語法直觀，適用於數據科學和後端開發。 2.JavaScript靈活，廣泛用於前端和服務器端編程。

PHP和Python：深入了解他們的歷史 Apr 18, 2025 am 12:25 AM

PHP起源於1994年，由RasmusLerdorf開發，最初用於跟踪網站訪問者，逐漸演變為服務器端腳本語言，廣泛應用於網頁開發。 Python由GuidovanRossum於1980年代末開發，1991年首次發布，強調代碼可讀性和簡潔性，適用於科學計算、數據分析等領域。

Golang vs. Python：性能和可伸縮性 Apr 19, 2025 am 12:18 AM

Golang在性能和可擴展性方面優於Python。 1)Golang的編譯型特性和高效並發模型使其在高並發場景下表現出色。 2)Python作為解釋型語言，執行速度較慢，但通過工具如Cython可優化性能。

vscode在哪寫代碼 Apr 15, 2025 pm 09:54 PM

在 Visual Studio Code（VSCode）中編寫代碼簡單易行，只需安裝 VSCode、創建項目、選擇語言、創建文件、編寫代碼、保存並運行即可。 VSCode 的優點包括跨平台、免費開源、強大功能、擴展豐富，以及輕量快速。

notepad 怎麼運行python Apr 16, 2025 pm 07:33 PM

在 Notepad 中運行 Python 代碼需要安裝 Python 可執行文件和 NppExec 插件。安裝 Python 並為其添加 PATH 後，在 NppExec 插件中配置命令為“python”、參數為“{CURRENT_DIRECTORY}{FILE_NAME}”，即可在 Notepad 中通過快捷鍵“F6”運行 Python 代碼。

See all articles

python爬蟲：隨心所欲地爬取百度圖片

熱AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

熱門文章

熱工具

記事本++7.3.1

SublimeText3漢化版

禪工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

熱門話題