Python怎麼爬蟲淘寶商品數據-Python教學-PHP中文網

首頁

後端開發

Python教學

Python怎麼爬蟲淘寶商品數據

尚

Jun 28, 2019 pm 04:58 PM

Python怎麼爬蟲淘寶商品數據

這次的主要的目的是從淘寶的搜尋頁面取得商品的資訊。其實分析頁面找到資訊很容易，頁面資訊的存放都是以靜態的方式直接嵌套的頁面上的，很容易找到。主要困難是將資訊從HTML來源碼中剝離出來，資料和網頁原始碼結合的很緊密，剝離資料有一定的難度。

接著將取得的資訊寫入excel表格儲存起來，這次只爬取了前面10頁的內容。

程式碼如下：

import requests
import re
from xlwt import Workbook
import xlrd
import time
def key_name( number ):
    #获取页面的内容并返回
    name = &#39;手机&#39;
    URL_1 = "https://s.taobao.com/search?ie=utf8&initiative_id=staobaoz_20170905&stats_click=search_radio_all%3A1&js=1&imgfile=&q="
    URL_2 = "&suggest=0_1&_input_charset=utf-8&wq=u&suggest_query=u&source=suggest&p4ppushleft=5%2C48&s="
    URL = ( URL_1 + name + URL_2 + str(number))
    #print(URL)
    res = requests.get( URL )
    return res.text
def find_date( text):
    #根据整个页面的信息，获取商品的数据所在的HTML源码并放回
    reg = r&#39;,"data":{"spus":\[({.+?)\]}},"header":&#39;
    reg = re.compile(reg)
    info = re.findall(reg, text)
    return info[0]
def manipulation_data( info, N, sheet ):
    #解析获取的HTML源码，获取数据
    Date = eval(info)
    for d in Date:
        T = " ".join([t[&#39;tag&#39;] for t in d[&#39;tag_info&#39;]])
        #print(d[&#39;title&#39;] + &#39;\t&#39; + d[&#39;price&#39;] + &#39;\t&#39; + d[&#39;importantKey&#39;][0:len(d[&#39;importantKey&#39;])-1] + &#39;\t&#39; + T)
        
        sheet.write(N,0,d[&#39;title&#39;])
        sheet.write(N,1,d[&#39;price&#39;])
        sheet.write(N,2,T)
        N = N + 1
    return N
    
    
def main():
    
    book = Workbook()
    sheet = book.add_sheet(&#39;淘宝手机数据&#39;)
    sheet.write(0,0,&#39;品牌&#39;)
    sheet.write(0,1,&#39;价格&#39;)
    sheet.write(0,2,&#39;配置&#39;)
    book.save(&#39;淘宝手机数据.xls&#39;)
    #k用于生成链接，每个链接的最后面的数字相差48.
    #N用于记录表格的数据行数，便于写入数据
    k = 0
    N = 1
    for i in range(10+1):
        text = key_name( k + i * 48 )
        info = find_date(text)
        N = manipulation_data( info ,N, sheet )
    
        book.save(&#39;淘宝手机数据.xls&#39;)
        print(&#39;下载第&#39; + str(i) + &#39;页完成&#39;)
if __name__ == &#39;__main__&#39;:
    main()

登入後複製

更多Python相關技術文章，請造訪Python教學欄位進行學習！

以上是Python怎麼爬蟲淘寶商品數據的詳細內容。更多資訊請關注PHP中文網其他相關文章！

本網站聲明

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

熱AI工具

熱工具

熱門話題

Java教學

1665

CakePHP 教程

1424

Laravel 教程

1322

PHP教程

1270

C# 教程

1250

Related knowledge

Python vs.C：申請和用例 Apr 12, 2025 am 12:01 AM

Python适合数据科学、Web开发和自动化任务，而C 适用于系统编程、游戏开发和嵌入式系统。Python以简洁和强大的生态系统著称，C 则以高性能和底层控制能力闻名。

Python：遊戲，Guis等 Apr 13, 2025 am 12:14 AM

Python在遊戲和GUI開發中表現出色。 1)遊戲開發使用Pygame，提供繪圖、音頻等功能，適合創建2D遊戲。 2)GUI開發可選擇Tkinter或PyQt，Tkinter簡單易用，PyQt功能豐富，適合專業開發。

Python與C：學習曲線和易用性 Apr 19, 2025 am 12:20 AM

Python更易學且易用，C 則更強大但複雜。 1.Python語法簡潔，適合初學者，動態類型和自動內存管理使其易用，但可能導致運行時錯誤。 2.C 提供低級控制和高級特性，適合高性能應用，但學習門檻高，需手動管理內存和類型安全。

Python和時間：充分利用您的學習時間 Apr 14, 2025 am 12:02 AM

要在有限的時間內最大化學習Python的效率，可以使用Python的datetime、time和schedule模塊。 1.datetime模塊用於記錄和規劃學習時間。 2.time模塊幫助設置學習和休息時間。 3.schedule模塊自動化安排每週學習任務。

Python vs.C：探索性能和效率 Apr 18, 2025 am 12:20 AM

Python在開發效率上優於C ，但C 在執行性能上更高。 1.Python的簡潔語法和豐富庫提高開發效率。 2.C 的編譯型特性和硬件控制提升執行性能。選擇時需根據項目需求權衡開發速度與執行效率。

Python：自動化，腳本和任務管理 Apr 16, 2025 am 12:14 AM

Python在自動化、腳本編寫和任務管理中表現出色。 1)自動化：通過標準庫如os、shutil實現文件備份。 2)腳本編寫：使用psutil庫監控系統資源。 3)任務管理：利用schedule庫調度任務。 Python的易用性和豐富庫支持使其在這些領域中成為首選工具。

Python標準庫的哪一部分是：列表或數組？ Apr 27, 2025 am 12:03 AM

pythonlistsarepartofthestAndArdLibrary，herilearRaysarenot.listsarebuilt-In，多功能，和Rused ForStoringCollections，而EasaraySaraySaraySaraysaraySaraySaraysaraySaraysarrayModuleandleandleandlesscommonlyusedDduetolimitedFunctionalityFunctionalityFunctionality。