


Detaillierte Einführung in das Video-Crawling mit dem Python-Crawler
Der Inhalt dieses Artikels ist eine detaillierte Einführung in das Crawlen von Python-Crawlern. Ich hoffe, dass er für Freunde hilfreich ist.
Ich schreibe gerade eine Anwendung, die einige beliebte Videos auf Weibo sammeln muss. Diese kurzen Videos stammen im Allgemeinen von Miaopai, Weipai, Meipai und Sina Video, und es gibt keine Download-Option, daher kann ich nur Ihre verwenden Gehirn, um über eine Lösung nachzudenken.
Der erste Schritt
Analysieren Sie den Quellcode der Webseite. Beispiel: http://video.weibo.com/show?fid=1034:0988e59a12e5178acb7f23adc3fe5e97, klicken Sie mit der rechten Maustaste, um den Quellcode anzuzeigen. Wenn Sie suchen, werden Sie ihn nicht finden, aber einige können direkt angesehen werden, z. B. Meipai-Videos.
Der zweite Schritt
Erfassen Sie das Paket, analysieren Sie die Anfrage und senden Sie es zurück. Dies kann auch über das leistungsstarke Chrome erreicht werden, wie im obigen Beispiel: Klicken Sie mit der rechten Maustaste->Element prüfen->Netzwerk und aktualisieren Sie dann die Webseite mit F5
Es ist Ich habe festgestellt, dass es viele Anfragen gibt und diese nur einzeln gestellt werden können. Tatsächlich handelt es sich bei den Videoformaten um MP4, FLV und AVI. Sie können es sofort in den Browser kopieren und öffnen. Es ist der Download-Link, den wir wollen.
Der dritte Schritt
Analysieren Sie die Muster von Download-Links und Video-Links. Das heißt, die Beziehung zwischen http://video.weibo.com/show?fid=1034:0988e59a12e5178acb7f23adc3fe5e97 und xxx.mp4. Dies erfordert wiederum eine Analyse des Quellcodes der Webseite. Sie können auf den Link mit dem Suffix .m3u8 achten. Wenn Sie ihn öffnen, wird er von der Wiedergabesoftware nicht abgespielt Verwenden Sie die Netzwerkadresse der Datei, um sie online abzuspielen, öffnen Sie sie und stellen Sie sicher, dass der gewünschte Download-Link tatsächlich darin aufgezeichnet ist. Darüber hinaus befindet sich der Link mit der Endung .m3u8 im Quellcode der Webseite.
Zusammenfassung
Nach der Analyse der ersten drei Schritte besteht die Idee zum Erhalten des Video-Download-Links darin, zunächst den Suffix-Link .m3u8 von zu erhalten Laden Sie den Quellcode der Webseite herunter, laden Sie die Datei herunter, laden Sie den Video-Download-Link herunter und laden Sie schließlich das Video herunter
Quellcode
#sinavideo.py #coding=utf-8 import os import re import urllib2 import urllib from common import Common class SinaVideo(): URL_PIRFIX = "http://us.sinaimg.cn/" def getM3u8(self,html): reg = re.compile(r'list=([\s\S]*?)&fid') result = reg.findall(html) return result[0] def getName(self,url): return url.split('=')[1] def getSinavideoUrl(self,filepath): f = open(filepath,'r') lines = f.readlines() f.close() for line in lines: if line[0] !='#': return line def download(self,url,filepath): #获取名称 name = self.getName(url) html = Common.getHtml(url) m3u8 = self.getM3u8(html) Common.download(urllib.unquote(m3u8),filepath,name + '.m3u8') url = self.URL_PIRFIX + self.getSinavideoUrl(filepath+name+'.m3u8') Common.download(url,filepath,name+'.mp4')
#common.py #coding=utf-8 import urllib2 import os import re class Common(): # 获取网页源码 @staticmethod def getHtml(url): html = urllib2.urlopen(url).read() print "[+]获取网页源码:"+url return html # 下载文件 @staticmethod def download(url,filepath,filename): headers = { 'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8', 'Accept-Charset': 'UTF-8,*;q=0.5', 'Accept-Encoding': 'gzip,deflate,sdch', 'Accept-Language': 'en-US,en;q=0.8', 'User-Agent': 'Mozilla/5.0 (Linux; Android 4.4.2; Nexus 4 Build/KOT49H) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/34.0.1847.114 Mobile Safari/537.36' } request = urllib2.Request(url,headers = headers); response = urllib2.urlopen(request) path = filepath + filename with open(path,'wb') as output: while True: buffer = response.read(1024*256); if not buffer: break # received += len(buffer) output.write(buffer) print "[+]下载文件成功:"+path @staticmethod def isExist(filepath): return os.path.exists(filepath) @staticmethod def createDir(filepath): os.makedirs(filepath,0777)
Aufrufmethode:
url = "http://video.weibo.com/show?fid=1034:0988e59a12e5178acb7f23adc3fe5e97"sinavideo = SinaVideo() sinavideo.download(url,""/Users/cheng/Documents/PyScript/res/"")
Ergebnis
Das obige ist der detaillierte Inhalt vonDetaillierte Einführung in das Video-Crawling mit dem Python-Crawler. Für weitere Informationen folgen Sie bitte anderen verwandten Artikeln auf der PHP chinesischen Website!

Heiße KI -Werkzeuge

Undresser.AI Undress
KI-gestützte App zum Erstellen realistischer Aktfotos

AI Clothes Remover
Online-KI-Tool zum Entfernen von Kleidung aus Fotos.

Undress AI Tool
Ausziehbilder kostenlos

Clothoff.io
KI-Kleiderentferner

Video Face Swap
Tauschen Sie Gesichter in jedem Video mühelos mit unserem völlig kostenlosen KI-Gesichtstausch-Tool aus!

Heißer Artikel

Heiße Werkzeuge

Notepad++7.3.1
Einfach zu bedienender und kostenloser Code-Editor

SublimeText3 chinesische Version
Chinesische Version, sehr einfach zu bedienen

Senden Sie Studio 13.0.1
Leistungsstarke integrierte PHP-Entwicklungsumgebung

Dreamweaver CS6
Visuelle Webentwicklungstools

SublimeText3 Mac-Version
Codebearbeitungssoftware auf Gottesniveau (SublimeText3)

Heiße Themen

Lösung für Erlaubnisprobleme beim Betrachten der Python -Version in Linux Terminal Wenn Sie versuchen, die Python -Version in Linux Terminal anzuzeigen, geben Sie Python ein ...

Wie lehre ich innerhalb von 10 Stunden die Grundlagen für Computer -Anfänger für Programmierungen? Wenn Sie nur 10 Stunden Zeit haben, um Computer -Anfänger zu unterrichten, was Sie mit Programmierkenntnissen unterrichten möchten, was würden Sie dann beibringen ...

Wie kann man nicht erkannt werden, wenn Sie Fiddlereverywhere für Man-in-the-Middle-Lesungen verwenden, wenn Sie FiddLereverywhere verwenden ...

Bei der Verwendung von Pythons Pandas -Bibliothek ist das Kopieren von ganzen Spalten zwischen zwei Datenrahmen mit unterschiedlichen Strukturen ein häufiges Problem. Angenommen, wir haben zwei Daten ...

Wie hört Uvicorn kontinuierlich auf HTTP -Anfragen an? Uvicorn ist ein leichter Webserver, der auf ASGI basiert. Eine seiner Kernfunktionen ist es, auf HTTP -Anfragen zu hören und weiterzumachen ...

Fastapi ...

Verständnis der Anti-Crawling-Strategie von Investing.com Viele Menschen versuchen oft, Nachrichten von Investing.com (https://cn.investing.com/news/latest-news) zu kriechen ...

Wie erstellt in Python ein Objekt dynamisch über eine Zeichenfolge und ruft seine Methoden auf? Dies ist eine häufige Programmieranforderung, insbesondere wenn sie konfiguriert oder ausgeführt werden muss ...
