Kann der Python-Crawler Videos crawlen?

爱喝马黛茶的安东尼
Freigeben: 2019-06-19 10:16:08
Original
5435 Leute haben es durchsucht

Webcrawler, auch Webspider genannt, bezeichnen Skriptprogramme, die nach bestimmten Regeln die benötigten Inhalte im Web crawlen. Wie wir alle wissen, enthält jede Webseite normalerweise Eingänge zu anderen Webseiten, und Webcrawler verwenden eine URL, um nacheinander andere URLs einzugeben, um den erforderlichen Inhalt zu erhalten.

Kann der Python-Crawler Videos crawlen?

Crawler-Struktur

Crawler-Planer ( Eingang des Programms, der zum Starten des gesamten Programms verwendet wird)

URL-Manager (wird zur Verwaltung nicht gecrawlter URLs und gecrawlter URLs verwendet)

Webseiten-Downloader (wird zum Herunterladen von Webseiteninhalten zur Analyse verwendet)

Webseiten-Parser (wird zum Parsen heruntergeladener Webseiten und zum Abrufen neuer URLs und erforderlicher Inhalte verwendet)

Webseiten-Ausgabeprogramm (wird verwendet, um den erhaltenen Inhalt in Form einer Datei auszugeben)

Erster Schritt

Analysieren Sie den Quellcode der Webseite. Beispiel: http://video.weibo.com/show?fid=1034:0988e59a12e5178acb7f23adc3fe5e97, klicken Sie mit der rechten Maustaste, um den Quellcode anzuzeigen. Wenn Sie suchen, werden Sie ihn nicht finden, aber einige können direkt angesehen werden, z. B. Meipai-Videos.

Verwandte Empfehlungen: „Python-Video-Tutorial

Schritt 2

Erfassen Sie das Paket, analysieren Sie die Anfrage und senden Sie es zurück. Dies kann auch über das leistungsstarke Chrome erreicht werden, wie im obigen Beispiel: Rechtsklick->Element prüfen->Netzwerk, dann aktualisieren Sie die Webseite mit F5

Ich habe festgestellt, dass es viele Videoformate gibt, die nur einzeln analysiert werden können. Sie können sie auf einmal in den Browser kopieren und öffnen Genug, es ist der Download-Link, den wir wollen.

Der dritte Schritt

Analysieren Sie die Muster von Download-Links und Video-Links. Das heißt, die Beziehung zwischen http://video.weibo.com/show?fid=1034:0988e59a12e5178acb7f23adc3fe5e97 und xxx.mp4. Dies erfordert wiederum eine Analyse des Quellcodes der Webseite. Sie können auf den Link mit dem Suffix .m3u8 achten. Wenn Sie ihn öffnen, wird er von der Wiedergabesoftware nicht abgespielt Verwenden Sie die Netzwerkadresse der Datei, um sie online abzuspielen, und prüfen Sie, ob der gewünschte Download-Link tatsächlich darin aufgezeichnet ist. Darüber hinaus befindet sich der Link mit der Endung .m3u8 im Quellcode der Webseite.

Zusammenfassung

Nach der Analyse der ersten drei Schritte entstand die Idee von ​​​​Beziehen des Video-Download-Links Holen Sie sich einfach den Link mit dem Suffix .m3u8 aus dem Quellcode der Webseite, laden Sie die Datei herunter, holen Sie sich den Video-Download-Link daraus und laden Sie schließlich das Video herunter

Quellcode

#coding=utf-8
import os
import re
import urllib2
import urllib
from common import Common
class SinaVideo():
 
    URL_PIRFIX = "http://us.sinaimg.cn/"
    def getM3u8(self,html):
        reg = re.compile(r'list=([\s\S]*?)&fid')
        result = reg.findall(html)
        return result[0]
 
 
    def getName(self,url):
         return url.split('=')[1]
 
    def getSinavideoUrl(self,filepath):
        f = open(filepath,'r')
        lines = f.readlines()
        f.close()
        for line in lines:
            if line[0] !='#':
                return line
 
    def download(self,url,filepath):
        #获取名称
        name = self.getName(url)
        html = Common.getHtml(url)
        m3u8 = self.getM3u8(html)
        Common.download(urllib.unquote(m3u8),filepath,name + '.m3u8')
        url = self.URL_PIRFIX + self.getSinavideoUrl(filepath+name+'.m3u8')
        Common.download(url,filepath,name+'.mp4')
Nach dem Login kopieren
rrree

Aufrufmethode:

#common.py
#coding=utf-8
import urllib2
import os
import re
 
 
class Common():
    #  获取网页源码
    @staticmethod
    def getHtml(url):
        html = urllib2.urlopen(url).read()
        print  "[+]获取网页源码:"+url
        return html
 
    # 下载文件
    @staticmethod
    def download(url,filepath,filename):
        headers = {
            'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
            'Accept-Charset': 'UTF-8,*;q=0.5',
            'Accept-Encoding': 'gzip,deflate,sdch',
            'Accept-Language': 'en-US,en;q=0.8',
            'User-Agent': 'Mozilla/5.0 (Linux; Android 4.4.2; Nexus 4 Build/KOT49H) 
            AppleWebKit/537.36 (KHTML, like Gecko) Chrome/34.0.1847.114 Mobile Safari/537.36'
        }
        request = urllib2.Request(url,headers = headers);
        response = urllib2.urlopen(request)
        path = filepath + filename
        with open(path,'wb') as output:
            while True:
                buffer = response.read(1024*256);
                if not buffer:
                    break
                # received += len(buffer)
                output.write(buffer)
 
        print "[+]下载文件成功:"+path
 
    @staticmethod
    def isExist(filepath):
        return os.path.exists(filepath)
 
    @staticmethod
    def createDir(filepath):
         os.makedirs(filepath,0777)
Nach dem Login kopieren

Ergebnis:

Das obige ist der detaillierte Inhalt vonKann der Python-Crawler Videos crawlen?. Für weitere Informationen folgen Sie bitte anderen verwandten Artikeln auf der PHP chinesischen Website!

Verwandte Etiketten:
Quelle:php.cn
Erklärung dieser Website
Der Inhalt dieses Artikels wird freiwillig von Internetnutzern beigesteuert und das Urheberrecht liegt beim ursprünglichen Autor. Diese Website übernimmt keine entsprechende rechtliche Verantwortung. Wenn Sie Inhalte finden, bei denen der Verdacht eines Plagiats oder einer Rechtsverletzung besteht, wenden Sie sich bitte an admin@php.cn
Beliebte Tutorials
Mehr>
Neueste Downloads
Mehr>
Web-Effekte
Quellcode der Website
Website-Materialien
Frontend-Vorlage
Über uns Haftungsausschluss Sitemap
Chinesische PHP-Website:Online-PHP-Schulung für das Gemeinwohl,Helfen Sie PHP-Lernenden, sich schnell weiterzuentwickeln!