Python で Taobao 製品データをクロールする方法-Python チュートリアル-php.cn

ホームページ

バックエンド開発

Python チュートリアル

Python で Taobao 製品データをクロールする方法

尚

Jun 28, 2019 pm 04:58 PM

Python で Taobao 製品データをクロールする方法

今回の主な目的はタオバオの検索ページから商品情報を取得することです。実際、ページを分析することで情報を見つけるのは簡単です。ページ情報はネストされたページに静的に直接保存されるため、見つけやすくなります。主な問題は、情報を HTML ソースコードから分離することですが、データと Web ページのソースコードは密接に統合されているため、データを分離するのは困難です。

取得した情報を Excel の表に書き込んで保存します。今回は最初の 10 ページのコンテンツのみがクロールされました。

コードは次のとおりです:

import requests
import re
from xlwt import Workbook
import xlrd
import time
def key_name( number ):
    #获取页面的内容并返回
    name = &#39;手机&#39;
    URL_1 = "https://s.taobao.com/search?ie=utf8&initiative_id=staobaoz_20170905&stats_click=search_radio_all%3A1&js=1&imgfile=&q="
    URL_2 = "&suggest=0_1&_input_charset=utf-8&wq=u&suggest_query=u&source=suggest&p4ppushleft=5%2C48&s="
    URL = ( URL_1 + name + URL_2 + str(number))
    #print(URL)
    res = requests.get( URL )
    return res.text
def find_date( text):
    #根据整个页面的信息，获取商品的数据所在的HTML源码并放回
    reg = r&#39;,"data":{"spus":\[({.+?)\]}},"header":&#39;
    reg = re.compile(reg)
    info = re.findall(reg, text)
    return info[0]
def manipulation_data( info, N, sheet ):
    #解析获取的HTML源码，获取数据
    Date = eval(info)
    for d in Date:
        T = " ".join([t[&#39;tag&#39;] for t in d[&#39;tag_info&#39;]])
        #print(d[&#39;title&#39;] + &#39;\t&#39; + d[&#39;price&#39;] + &#39;\t&#39; + d[&#39;importantKey&#39;][0:len(d[&#39;importantKey&#39;])-1] + &#39;\t&#39; + T)
        
        sheet.write(N,0,d[&#39;title&#39;])
        sheet.write(N,1,d[&#39;price&#39;])
        sheet.write(N,2,T)
        N = N + 1
    return N
    
    
def main():
    
    book = Workbook()
    sheet = book.add_sheet(&#39;淘宝手机数据&#39;)
    sheet.write(0,0,&#39;品牌&#39;)
    sheet.write(0,1,&#39;价格&#39;)
    sheet.write(0,2,&#39;配置&#39;)
    book.save(&#39;淘宝手机数据.xls&#39;)
    #k用于生成链接，每个链接的最后面的数字相差48.
    #N用于记录表格的数据行数，便于写入数据
    k = 0
    N = 1
    for i in range(10+1):
        text = key_name( k + i * 48 )
        info = find_date(text)
        N = manipulation_data( info ,N, sheet )
    
        book.save(&#39;淘宝手机数据.xls&#39;)
        print(&#39;下载第&#39; + str(i) + &#39;页完成&#39;)
if __name__ == &#39;__main__&#39;:
    main()

ログイン後にコピー

Python 関連の技術記事の詳細については、Python チュートリアル列にアクセスして学習してください。

以上がPython で Taobao 製品データをクロールする方法の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

このウェブサイトの声明

この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。