PHP 컬렉션 클래스 스누피 예제 소개
Snoopy는 웹 브라우저의 기능을 모방하는 데 사용되는 PHP 클래스로, 웹 콘텐츠를 얻고 양식을 보내는 작업을 완료할 수 있습니다. 공식 웹사이트 http://snoopy.sourceforge.net/
스누피의 일부 기능:
웹 페이지의 콘텐츠 가져오기 fetch()
웹 페이지의 텍스트 콘텐츠 캡처(HTML 태그 제거) fetchtext()
웹 링크 캡처, fetchlinks 양식() fetchform()
프록시 호스트 지원
기본 사용자 이름/비밀번호 확인 지원
user_agent, 리퍼러(소스), 쿠키 설정 지원 헤더 콘텐츠(헤더 파일)
브라우저 리디렉션 지원 및 리디렉션 깊이 제어 가능
웹 페이지의 링크를 고품질 URL로 확장 가능(기본값)
데이터 제출 및 반환 값 가져오기
-
HTML 프레임워크 추적 지원
리디렉션 시 쿠키 전달 지원
php4 이상이 필요합니다. PHP 클래스이므로 지원을 확장할 필요가 없습니다. 서버가 컬을 지원하지 않는 경우 최선의 선택입니다.
클래스 메소드
1.fetch($uri)
웹 페이지의 내용을 가져오는 데 사용되는 메소드입니다. $URI 매개변수는 크롤링된 웹페이지의 URL 주소입니다. 가져온 결과는 $this->results에 저장됩니다.
프레임을 스크랩하는 경우 스누피는 각 프레임을 추적하여 배열에 저장한 다음 $this->result에 저장합니다.
<?php $url = "http://www.nowamagic.net/librarys/veda/"; include("./Snoopy.class.php"); $snoopy = new Snoopy; $snoopy->fetch($url); //获取所有内容 echo $snoopy->results; //显示结果 ?>
로그인 후 복사
2.fetchtext($URI)
이 방법은 fetch()와 유사하지만 유일한 차이점은 이 방법은 HTML 태그 및 기타 관련 없는 데이터를 제거하고 웹의 텍스트 콘텐츠만 반환한다는 것입니다. 페이지.
<?php $url = "http://www.nowamagic.net/librarys/veda/"; include("./Snoopy.class.php"); $snoopy = new Snoopy; $snoopy->fetchtext($url); //获取文本内容 echo $snoopy->results; //显示结果 ?>
로그인 후 복사
3.fetchform($URI)
이 메서드는 fetch()와 유사하지만 유일한 차이점은 이 메서드는 HTML 태그 및 기타 관련 없는 데이터를 제거하고 양식 내용(form)만 반환한다는 것입니다. 웹 페이지에서.
4. fetchlinks($URI)
이 방법은 fetch()와 유사하지만 유일한 차이점은 이 방법은 HTML 태그 및 기타 관련 없는 데이터를 제거하고 웹 페이지의 링크만 반환한다는 것입니다. 기본적으로 상대 링크는 자동으로 완성되고 전체 URL로 변환됩니다.
5. submit($URI,$formvars)
$URL에 지정된 링크 주소로 확인 양식을 보내는 메소드입니다. $formvars는 양식 매개변수를 저장하는 배열입니다.
6. submittext($URI,$formvars)
이 메소드는 submit()과 유사하지만, 유일한 차이점은 이 메소드는 HTML 태그 및 기타 관련 없는 데이터를 제거하고 이후 웹 페이지의 텍스트 내용만 반환한다는 것입니다. 로그인.
7. submitlinks($URI)
이 메소드는 submit()과 유사하지만 유일한 차이점은 이 메소드는 HTML 태그 및 기타 관련 없는 데이터를 제거하고 웹 페이지의 링크만 반환한다는 것입니다. 기본적으로 상대 링크는 자동으로 완성되고 전체 URL로 변환됩니다.
클래스 속성 (기본값은 괄호 안에 있음)
$host
$port에 연결할 호스트
$proxy_host 사용할 프록시 호스트(있는 경우)
$ Proxy_port 사용된 프록시 호스트 포트(있는 경우)
$agent 사용자 에이전트 위장(Snoopy v0.1)
$referer 소스 정보(있는 경우)
$cookies 쿠키(있는 경우) If
$rawheaders 기타 헤더 정보(있는 경우)
$maxredirs 최대 리디렉션 수, 0=허용되지 않음(5)
$offsiteok 오프사이트 리디렉션 허용 여부(true)
$expandlinks 전체 주소에 대한 모든 링크를 완료할지 여부(true)
$user 인증 사용자 이름(있는 경우)
$pass 인증 사용자 이름(있는 경우)
$accept http 허용 유형( image/gif, image/x-xbitmap, image/jpeg, image/pjpeg, */*)
$error 오류가 있는 경우 보고할 위치
$ response_code 서버에서 반환된 응답 코드
$headers 서버에서 반환된 헤더 정보
$maxlength 반환된 최대 데이터 길이
$read_timeout 읽기 작업 시간 초과(PHP 4 Beta 4+ 필요), 설정 0은 시간 초과 없음을 의미함
$timed_out If 읽기 작업이 시간 초과되면 이 속성은 true를 반환합니다(PHP 4 Beta 4+ 필요)
$maxframes 추적이 허용되는 최대 프레임 수
$status Catch http 상태 가져오기
$temp_dir 웹 서버가
$curl_path cURL 바이너리 디렉토리에 쓸 수 있는 임시 파일 디렉토리(/tmp), cURL 바이너리가 없으면 false로 설정
Demo
include "Snoopy.class.php"; $snoopy = new Snoopy; $snoopy->proxy_host = "http://www.nowamagic.net/librarys/veda/"; $snoopy->proxy_port = "80"; $snoopy->agent = "(compatible; MSIE 4.01; MSN 2.5; AOL 4.0; Windows 98)"; $snoopy->referer = "http://www.4wei.cn"; $snoopy->cookies["SessionID"] = 238472834723489l; $snoopy->cookies["favoriteColor"] = "RED"; $snoopy->rawheaders["Pragma"] = "no-cache"; $snoopy->maxredirs = 2; $snoopy->offsiteok = false; $snoopy->expandlinks = false; $snoopy->user = "joe"; $snoopy->pass = "bloe"; if($snoopy->fetchtext("http://www.4wei.cn")) { echo "<PRE>".htmlspecialchars($snoopy->results)."
n"; } else echo "error fetching document: ".$snoopy->error."n";로그인 후 복사
Get 지정된 URL 콘텐츠:
<? $url = "http://www.nowamagic.net/librarys/veda/"; include("snoopy.php"); $snoopy = new Snoopy; $snoopy->fetch($url); //获取所有内容 echo $snoopy->results; //显示结果 //可选以下 //$snoopy->fetchtext //获取文本内容(去掉html代码) //$snoopy->fetchlinks //获取链接 //$snoopy->fetchform //获取表单 ?>
로그인 후 복사
양식 제출:
<?php $formvars["username"] = "admin"; $formvars["pwd"] = "admin"; $action = "http://www.nowamagic.net/librarys/veda/";//表单提交地址 $snoopy->submit($action,$formvars);//$formvars为提交的数组 echo $snoopy->results; //获取表单提交后的 返回的结果 //可选以下 $snoopy->submittext; //提交后只返回 去除html的 文本 $snoopy->submitlinks;//提交后只返回 链接 ?>
로그인 후 복사
이제 양식이 제출되었으므로 많은 작업을 수행할 수 있습니다. 다음으로 IP와 브라우저를 위장해 보겠습니다.
<?php $formvars["username"] = "admin"; $formvars["pwd"] = "admin"; $action = "http://www.4wei.cn"; include "snoopy.php"; $snoopy = new Snoopy; $snoopy->cookies["PHPSESSID"] = 'fc106b1918bd522cc863f36890e6fff7'; //伪装sessionid $snoopy->agent = "(compatible; MSIE 4.01; MSN 2.5; AOL 4.0; Windows 98)"; //伪装浏览器 $snoopy->referer = http://www.4wei.cn; //伪装来源页地址 http_referer $snoopy->rawheaders["Pragma"] = "no-cache"; //cache 的http头信息 $snoopy->rawheaders["X_FORWARDED_FOR"] = "127.0.0.101"; //伪装ip $snoopy->submit($action,$formvars); echo $snoopy->results;
로그인 후 복사?>
原来我们可以伪装session 伪装浏览器 ,伪装ip, haha 可以做很多事情了。例如 带验证码,验证ip 投票, 可以不停的投。
ps:这里伪装ip ,其实是伪装http头,所以一般的通过 REMOTE_ADDR 获取的ip是伪装不了,反而那些通过http头来获取ip的(可以防止代理的那种) 就可以自己来制造ip。
关于如何验证码 ,简单说下:首先用普通的浏览器, 查看页面 , 找到验证码所对应的sessionid,同时记下sessionid和验证码值,接下来就用snoopy去伪造 。
原理:由于是同一个sessionid 所以取得的验证码和第一次输入的是一样的。
有时我们可能需要伪造更多的东西,snoopy完全为我们想到了:
<?php $snoopy->proxy_host = "http://www.nowamagic.net/librarys/veda/"; $snoopy->proxy_port = "8080"; //使用代理 $snoopy->maxredirs = 2; //重定向次数 $snoopy->expandlinks = true; //是否补全链接 在采集的时候经常用到 // 例如链接为 /images/taoav.gif 可改为它的全链接 <a href="http://www.4wei.cn/images/taoav.gif">http://www.4wei.cn/images/taoav.gif</a> $snoopy->maxframes = 5 //允许的最大框架数 //注意抓取框架的时候 $snoopy->results 返回的是一个数组 $snoopy->error //返回报错信息 ?>
로그인 후 복사
比较完整的示例:
/** * You need the snoopy.class.php from * http://snoopy.sourceforge.net/ */ include("snoopy.class.php"); $snoopy = new Snoopy; // need an proxy?: //$snoopy->proxy_host = "my.proxy.host"; //$snoopy->proxy_port = "8080"; // set browser and referer: $snoopy->agent = "Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1)"; $snoopy->referer = "http://www.jonasjohn.de/"; // set some cookies: $snoopy->cookies["SessionID"] = '238472834723489'; $snoopy->cookies["favoriteColor"] = "blue"; // set an raw-header: $snoopy->rawheaders["Pragma"] = "no-cache"; // set some internal variables: $snoopy->maxredirs = 2; $snoopy->offsiteok = false; $snoopy->expandlinks = false; // set username and password (optional) //$snoopy->user = "joe"; //$snoopy->pass = "bloe"; // fetch the text of the website www.google.com: if($snoopy->fetchtext("http://www.google.com")){ // other methods: fetch, fetchform, fetchlinks, submittext and submitlinks // response code: print "response code: ".$snoopy->response_code."<br/>n"; // print the headers: print "<b>Headers:</b><br/>"; while(list($key,$val) = each($snoopy->headers)){ print $key.": ".$val."<br/>n"; } print "<br/>n"; // print the texts of the website: print htmlspecialchars($snoopy->results)."n"; } else { print "Snoopy: error while fetching document: ".$snoopy->error."n"; }
로그인 후 복사
用Snoopy类完成一个简单的图片采集:
<meta http-equiv='content-type' content='text/html;charset=utf-8'> <?php include 'Snoopy.class.php'; //加载Snoopy类 $snoopy = new Snoopy(); //实例化一个对象 $sourceURL = "http://www.nowamagic.net/librarys/veda/"; //要抓取的网页 $snoopy->fetchlinks($sourceURL); //获得网页的链接 $a = $snoopy->results; //得到网页链接的结果 $re = "/d+.html$/"; //匹配的正则 //过滤获取指定的文件地址请求 foreach ($a as $tmp) { if (preg_match($re, $tmp)) { $aa=$tmp; } } getImgURL($aa); function getImgURL($siteName) { $snoopy = new Snoopy(); $snoopy->fetch($siteName); $fileContent = $snoopy->results; //获取过滤后的页面的内容 //匹配图片的正则表达式 $reTag = "/<img[^s]+src="(http://[^"]+).(jpg|png|gif|jpeg)"[^/]*/>/i"; if (preg_match($reTag, $fileContent)) { //过滤图片 $ret = preg_match_all($reTag, $fileContent, $matchResult); for ($i = 0, $len = count($matchResult[1]); $i < $len; ++$i) { saveImgURL($matchResult[1][$i], $matchResult[2][$i]); } } } function saveImgURL($name, $suffix) { $url = $name.".".$suffix; echo "请求的图片地址:".$url."<br/>"; $imgSavePath = "E:/123/images/"; //图片保存地址 $imgId =mt_rand(); //产生一个随机的文件名 if ($suffix == "gif") { //根据图片类型,放入不同的文件夹下面 $imgSavePath .= "emotion"; } else { $imgSavePath .= "topic"; } $imgSavePath .= ("/".$imgId.".".$suffix); //组装要保存的文件名 if (is_file($imgSavePath)) { //判断文件名是否存在,存在则删除 unlink($imgSavePath); echo "<p style='color:#f00;'>文件".$imgSavePath."已存在,将被删除</p>"; } $imgFile = file_get_contents($url); //读取网络文件 $flag = file_put_contents($imgSavePath,$imgFile); //写入到本地 if ($flag) { echo "<p>文件".$imgSavePath."保存成功</p>"; } } ?>
로그인 후 복사
相关推荐:
위 내용은 PHP 컬렉션 클래스 스누피 예제 소개의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

핫 AI 도구

Undresser.AI Undress
사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover
사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool
무료로 이미지를 벗다

Clothoff.io
AI 옷 제거제

Video Face Swap
완전히 무료인 AI 얼굴 교환 도구를 사용하여 모든 비디오의 얼굴을 쉽게 바꾸세요!

인기 기사

뜨거운 도구

메모장++7.3.1
사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전
중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기
강력한 PHP 통합 개발 환경

드림위버 CS6
시각적 웹 개발 도구

SublimeText3 Mac 버전
신 수준의 코드 편집 소프트웨어(SublimeText3)

뜨거운 주제











PHP 8.4는 상당한 양의 기능 중단 및 제거를 통해 몇 가지 새로운 기능, 보안 개선 및 성능 개선을 제공합니다. 이 가이드에서는 Ubuntu, Debian 또는 해당 파생 제품에서 PHP 8.4를 설치하거나 PHP 8.4로 업그레이드하는 방법을 설명합니다.

JWT는 주로 신분증 인증 및 정보 교환을 위해 당사자간에 정보를 안전하게 전송하는 데 사용되는 JSON을 기반으로 한 개방형 표준입니다. 1. JWT는 헤더, 페이로드 및 서명의 세 부분으로 구성됩니다. 2. JWT의 작업 원칙에는 세 가지 단계가 포함됩니다. JWT 생성, JWT 확인 및 Parsing Payload. 3. PHP에서 인증에 JWT를 사용하면 JWT를 생성하고 확인할 수 있으며 사용자 역할 및 권한 정보가 고급 사용에 포함될 수 있습니다. 4. 일반적인 오류에는 서명 검증 실패, 토큰 만료 및 대형 페이로드가 포함됩니다. 디버깅 기술에는 디버깅 도구 및 로깅 사용이 포함됩니다. 5. 성능 최적화 및 모범 사례에는 적절한 시그니처 알고리즘 사용, 타당성 기간 설정 합리적,

이 튜토리얼은 PHP를 사용하여 XML 문서를 효율적으로 처리하는 방법을 보여줍니다. XML (Extensible Markup Language)은 인간의 가독성과 기계 구문 분석을 위해 설계된 다목적 텍스트 기반 마크 업 언어입니다. 일반적으로 데이터 저장 AN에 사용됩니다

정적 바인딩 (정적 : :)는 PHP에서 늦은 정적 바인딩 (LSB)을 구현하여 클래스를 정의하는 대신 정적 컨텍스트에서 호출 클래스를 참조 할 수 있습니다. 1) 구문 분석 프로세스는 런타임에 수행됩니다. 2) 상속 관계에서 통화 클래스를 찾아보십시오. 3) 성능 오버 헤드를 가져올 수 있습니다.

문자열은 문자, 숫자 및 기호를 포함하여 일련의 문자입니다. 이 튜토리얼은 다른 방법을 사용하여 PHP의 주어진 문자열의 모음 수를 계산하는 방법을 배웁니다. 영어의 모음은 A, E, I, O, U이며 대문자 또는 소문자 일 수 있습니다. 모음이란 무엇입니까? 모음은 특정 발음을 나타내는 알파벳 문자입니다. 대문자와 소문자를 포함하여 영어에는 5 개의 모음이 있습니다. a, e, i, o, u 예 1 입력 : String = "Tutorialspoint" 출력 : 6 설명하다 문자열의 "Tutorialspoint"의 모음은 u, o, i, a, o, i입니다. 총 6 개의 위안이 있습니다

PHP의 마법 방법은 무엇입니까? PHP의 마법 방법은 다음과 같습니다. 1. \ _ \ _ Construct, 객체를 초기화하는 데 사용됩니다. 2. \ _ \ _ 파괴, 자원을 정리하는 데 사용됩니다. 3. \ _ \ _ 호출, 존재하지 않는 메소드 호출을 처리하십시오. 4. \ _ \ _ get, 동적 속성 액세스를 구현하십시오. 5. \ _ \ _ Set, 동적 속성 설정을 구현하십시오. 이러한 방법은 특정 상황에서 자동으로 호출되어 코드 유연성과 효율성을 향상시킵니다.

PHP와 Python은 각각 고유 한 장점이 있으며 프로젝트 요구 사항에 따라 선택합니다. 1.PHP는 웹 개발, 특히 웹 사이트의 빠른 개발 및 유지 보수에 적합합니다. 2. Python은 간결한 구문을 가진 데이터 과학, 기계 학습 및 인공 지능에 적합하며 초보자에게 적합합니다.

PHP는 서버 측에서 널리 사용되는 스크립팅 언어이며 특히 웹 개발에 적합합니다. 1.PHP는 HTML을 포함하고 HTTP 요청 및 응답을 처리 할 수 있으며 다양한 데이터베이스를 지원할 수 있습니다. 2.PHP는 강력한 커뮤니티 지원 및 오픈 소스 리소스를 통해 동적 웹 컨텐츠, 프로세스 양식 데이터, 액세스 데이터베이스 등을 생성하는 데 사용됩니다. 3. PHP는 해석 된 언어이며, 실행 프로세스에는 어휘 분석, 문법 분석, 편집 및 실행이 포함됩니다. 4. PHP는 사용자 등록 시스템과 같은 고급 응용 프로그램을 위해 MySQL과 결합 할 수 있습니다. 5. PHP를 디버깅 할 때 error_reporting () 및 var_dump ()와 같은 함수를 사용할 수 있습니다. 6. 캐싱 메커니즘을 사용하여 PHP 코드를 최적화하고 데이터베이스 쿼리를 최적화하며 내장 기능을 사용하십시오. 7
