사실 뭔가 크롤링을 할 때마다 IP가 차단될까 봐 조금 더 지연 시간을 설정해야 하는데... 이번에는 Python을 사용해서 빌드를 해보겠습니다. 간단한 프록시 풀. 프록시 IP를 얻고 유효성을 확인하십시오. 그러나 그 결과는 그다지 이상적이지 않은 것 같습니다. 왜 West Spurs의 고고도 프록시를 사용할 수 있습니까? ? ? FA가 사용하기 쉽지 않다는 뜻 아닌가요? 정말 흑인의 물음표 얼굴이다...
NO.1 프록시 획득
01 웹페이지 분석
시샤 프록시 국내 고화질 프록시를 클릭하시면, 웹페이지 정보.
IP 주소, 포트, 익명 여부, 유형, 속도를 가져옵니다.
02 프록시 정보 가져오기
무작위로 선택된 헤더와 수면 시간을 설정하는 것을 잊지 마세요. 설정하지 않았는데 차단되었기 때문입니다...
import time import requests from bs4 import BeautifulSoup headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36' } for i in range(1, 36): time.sleep(2) print('第' + str(i) + '页') url = 'http://www.xicidaili.com/nn/' + str(i) response = requests.get(url=url, headers=headers) soup = BeautifulSoup(response.text, 'html.parser') all_trs = soup.find_all('tr') for tr in all_trs[1:]: all_tds = tr.find_all('td') ip = all_tds[1].get_text() port = all_tds[2].get_text() anonymous = all_tds[4].get_text() type = all_tds[5].get_text() for j in all_tds[6].find_all("div", attrs={"class": "bar"}): speed = j.get('title') with open('ip.csv', 'a+', encoding='utf-8-sig') as f: f.write(ip + ',' + port + ',' + anonymous + ',' + type + ',' + speed + '\n')
Get the User Agent Random 아래 코드에는 다음과 같은 기능이 포함되어 있지 않습니다.(결과적으로 차단되었으나 다음날 다시 사용 가능)
def get_user_agent(): ''' 随机获取一个用户代理 ''' user_agents=[ "Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; AcooBrowser; .NET CLR 1.1.4322; .NET CLR 2.0.50727)", "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 6.0; Acoo Browser; SLCC1; .NET CLR 2.0.50727; Media Center PC 5.0; .NET CLR 3.0.04506)", "Mozilla/4.0 (compatible; MSIE 7.0; AOL 9.5; AOLBuild 4337.35; Windows NT 5.1; .NET CLR 1.1.4322; .NET CLR 2.0.50727)", "Mozilla/5.0 (Windows; U; MSIE 9.0; Windows NT 9.0; en-US)", "Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; Win64; x64; Trident/5.0; .NET CLR 3.5.30729; .NET CLR 3.0.30729; .NET CLR 2.0.50727; Media Center PC 6.0)", "Mozilla/5.0 (compatible; MSIE 8.0; Windows NT 6.0; Trident/4.0; WOW64; Trident/4.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729; .NET CLR 1.0.3705; .NET CLR 1.1.4322)", "Mozilla/4.0 (compatible; MSIE 7.0b; Windows NT 5.2; .NET CLR 1.1.4322; .NET CLR 2.0.50727; InfoPath.2; .NET CLR 3.0.04506.30)", "Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN) AppleWebKit/523.15 (KHTML, like Gecko, Safari/419.3) Arora/0.3 (Change: 287 c9dfb30)", "Mozilla/5.0 (X11; U; Linux; en-US) AppleWebKit/527+ (KHTML, like Gecko, Safari/419.3) Arora/0.6", "Mozilla/5.0 (Windows; U; Windows NT 5.1; en-US; rv:1.8.1.2pre) Gecko/20070215 K-Ninja/2.1.1", "Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN; rv:1.9) Gecko/20080705 Firefox/3.0 Kapiko/3.0", "Mozilla/5.0 (X11; Linux i686; U;) Gecko/20070322 Kazehakase/0.4.5", "Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.9.0.8) Gecko Fedora/1.9.0.8-1.fc10 Kazehakase/0.5.6", "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.56 Safari/535.11", "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_3) AppleWebKit/535.20 (KHTML, like Gecko) Chrome/19.0.1036.7 Safari/535.20", "Opera/9.80 (Macintosh; Intel Mac OS X 10.6.8; U; fr) Presto/2.9.168 Version/11.52", "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.11 (KHTML, like Gecko) Chrome/20.0.1132.11 TaoBrowser/2.0 Safari/536.11", "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/21.0.1180.71 Safari/537.1 LBBROWSER", "Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; WOW64; Trident/5.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729; Media Center PC 6.0; .NET4.0C; .NET4.0E; LBBROWSER)", "Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; QQDownload 732; .NET4.0C; .NET4.0E; LBBROWSER)", "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.84 Safari/535.11 LBBROWSER", "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 6.1; WOW64; Trident/5.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729; Media Center PC 6.0; .NET4.0C; .NET4.0E)", "Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; WOW64; Trident/5.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729; Media Center PC 6.0; .NET4.0C; .NET4.0E; QQBrowser/7.0.3698.400)", "Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; QQDownload 732; .NET4.0C; .NET4.0E)", "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; Trident/4.0; SV1; QQDownload 732; .NET4.0C; .NET4.0E; 360SE)", "Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; QQDownload 732; .NET4.0C; .NET4.0E)", "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 6.1; WOW64; Trident/5.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729; Media Center PC 6.0; .NET4.0C; .NET4.0E)", "Mozilla/5.0 (Windows NT 5.1) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/21.0.1180.89 Safari/537.1", "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/21.0.1180.89 Safari/537.1", "Mozilla/5.0 (iPad; U; CPU OS 4_2_1 like Mac OS X; zh-cn) AppleWebKit/533.17.9 (KHTML, like Gecko) Version/5.0.2 Mobile/8C148 Safari/6533.18.5", "Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:2.0b13pre) Gecko/20110307 Firefox/4.0b13pre", "Mozilla/5.0 (X11; Ubuntu; Linux x86_64; rv:16.0) Gecko/20100101 Firefox/16.0", "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.11 (KHTML, like Gecko) Chrome/23.0.1271.64 Safari/537.11", "Mozilla/5.0 (X11; U; Linux x86_64; zh-CN; rv:1.9.2.10) Gecko/20100922 Ubuntu/10.10 (maverick) Firefox/3.6.10" ] # random.choice返回列表的随机项 user_agent = random.choice(user_agents) return user_agent # random.randint产生随机整数 time.sleep(2 + float(random.randint(1, 100)) / 20)
NO.2 프록시 검증
검증 결과 대부분의 것을 발견했습니다. 그 중 일부는 사용할 수 있는데, 가짜인지는 모르겠습니다.
Yunge Novel Network와 같이 이전에 인증 코드를 식별하는 데 사용되는 웹 사이트입니다.
200개 중 2개만 유효하지 않음, 비과학적~
import pandas as pd import numpy as np import requests import time df = pd.read_csv('ip.csv', header=None, names=["ip", "port", "anonymous", "proxy_type", "speed"]) proxy_types = ["{}".format(i) for i in np.array(df['proxy_type'])] ips = ["{}".format(i) for i in np.array(df['ip'])] ports = ["{}".format(i) for i in np.array(df['port'])] proxy_url = ['{0}://{1}:{2}'.format(proxy_types[i], ips[i], ports[i]) for i in range(len(ips))] proxy_type = ['{}'.format(i) for i in proxy_types] for i in range(200): time.sleep(1) proxies = { proxy_type[i]: proxy_url[i] } try: response = requests.get('http://www.quanben9.com/', proxies=proxies) except Exception as e: print('invalid ip and port') else: code = response.status_code if code == 200: print('effective ip') with open('effective_ip.csv', 'a+', encoding='utf-8-sig') as f: f.write(proxy_type[i] + ',' + proxy_url[i] + '\n') else: print('invalid ip and port')
NO.3 요약
IP 프로토콜: 인터넷 프로토콜, 다양한 데이터 패킷을 상대방에게 전송하는 기능(두 가지 중요한 조건, IP 주소 및 MAC) 주소).
IP 주소: 노드에 할당된 주소를 나타냅니다.
포트: 포트는 포트 번호로 표시됩니다. 포트 번호는 0에서 65535 사이의 정수입니다. IP 주소에는 65536개의 포트가 있습니다. "IP 주소 + 포트 번호"는 다양한 서비스(웹, FTP, SMTP)를 구분합니다.
HTTP: 하이퍼텍스트 전송 프로토콜(Hypertext Transfer Protocol)은 클라이언트에서 서버로 일련의 운영 프로세스를 완료합니다.
HTTPS: 암호화 및 인증 메커니즘이 추가된 HTTP입니다.
솔직히 예전에는 IP 주소, 포트, HTTP, HTTPS에 대해 전혀 몰랐습니다.
최근 Illustrated HTTP를 읽고 어느 정도 이해가 되었지만, 아주 일부분이고 아직 갈 길이 멀습니다.
하지만 로마는 하루아침에 이루어지지 않았습니다. 발전은 좋은 것입니다!
【추천 강좌: Python 칼럼 강좌】
위 내용은 Python을 사용하여 간단한 프록시 풀 구축의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!