目錄
'.$capture_url . "共找到" . $photo_num . " 張圖片
首頁 後端開發 php教程 php遠端抓取網站圖片並保存的程式碼

php遠端抓取網站圖片並保存的程式碼

Jul 25, 2016 am 09:12 AM

例子,php抓取網站資料的程式碼。

  1. /**
  2. * 一個用來抓取圖片的類別
  3. *
  4. * @package default
  5. * @author WuJunwei
  6. */
  7. class download_image
  8. {
  9. public $save_path;抓取圖片的保存位址
  10. //抓取圖片的大小限制(單位:位元組) 只抓比size比這個限制大的圖片
  11. public $img_size=0;
  12. //定義一個靜態陣列,用來記錄曾經抓取過的的超連結位址,避免重複抓取
  13. public static $a_url_arr=array();
  14. /**
  15. * @param String $save_path 抓取圖片的保存位址
  16. * @param Int $img_size 抓取圖片的保存位址
  17. * /
  18. public function __construct($save_path,$img_size)
  19. {
  20. $this->save_path=$save_path;
  21. $this->img_size=$img_size
  22. }
  23. ; 🎜> /**
  24. * 遞歸下載抓取首頁及其子頁圖片的方法 ( recursive 遞歸)
  25. *
  26. * @param String $capture_url 用於抓取圖片的網址
  27. *
  28. */
  29. public function recursive_download_images($capture_url)
  30. {
  31. if (!in_array($capture_url,self::$a_url_arr)) //沒抓取
  32. {
  33. self::$a_url_arr[]=$capture_url; //計入靜態陣列
  34. } else //抓取過,直接退出函數
  35. {
  36. return;
  37. }
  38. $this->download_current_page_images($capture_url); //下載目前頁面的所有圖片
  39. //用@屏蔽掉因為抓取位址無法讀取導致的warning錯誤
  40. $ content=@file_get_contents($capture_url);
  41. //符合a標籤href屬性中?之前部分的正規
  42. $a_pattern = "|]+href=['" ]? ([^ '"?]+)['" >]|U";
  43. preg_match_all($a_pattern, $content, $a_out, PREG_SET_ORDER);
  44. $tmp_arr=array(); //定義一個陣列,用來存放目前迴圈下抓取圖片的超連結位址
  45. foreach ($a_out as $k => $v)
  46. {
  47. /**
  48. * 去除超連結中的空'','#','/'和重複值
  49. * 1: 超連結位址的值不能等於目前抓取頁面的url, 否則會陷入死循環
  50. * 2: 超連結為''或'#','/'也是本頁,這樣也會陷入死循環,
  51. * 3: 有時一個超連接地址在一個網頁中會重複出現多次,如果不去除,會對一個子頁面進行重複下載)
  52. */
  53. if ( $v[1] && !in_array($v[1],self::$a_url_arr) &&!in_array($v[1],array('#','/',$capture_url) ) )
  54. {
  55. $tmp_arr[]=$v[1];
  56. }
  57. }
  58. foreach ($tmp_arr as $k => $v)
  59. {
  60. / /超連結路徑位址
  61. if ( strpos($v, 'http://')!==false ) //如果url包含http://,可以直接存取
  62. {
  63. $a_url = $v;
  64. }else //否則證明是相對位址, 需要重新拼湊超連結的存取位址
  65. {
  66. $domain_url = substr($capture_url, 0,strpos($capture_url, '/', 8)+1);
  67. $a_url=$domain_url.$v;
  68. }
  69. $this->recursive_download_images($a_url);
  70. }
  71. }
  72. }
  73. }
  74. }
  75. }
  76. }
  77. }
  78. }
  79. }
  80. }
  81. }
  82. }
  83. }
  84. }
  85. }
  86. /**
  87. * 下載目前網頁下的所有圖片
  88. *
  89. * @param String $capture_url 用於抓取圖片的網頁位址
  90. * @return Array 目前網頁上所有圖片img標籤url位址的一個數組
  91. */
  92. public function download_current_page_images($capture_url)
  93. { $content=@file_get_contents($capture_url); //屏蔽錯誤 $content=@file_get_contents($capture_url); //屏蔽錯誤 符合img標籤src屬性中?之前部分的正規 $img_pattern = "|php遠端抓取網站圖片並保存的程式碼]+src=['" ]?([^ '"?]+)['" >]|U" ; preg_match_all($img_pattern, $content, $img_out, PREG_SET_ORDER); $photo_num = count($img_out); //符合到的圖片數量 echo '

    '.$capture_url . "共找到" . $photo_num . " 張圖片

    "; foreach ($img_out as $k => $v) { $this->save_one_img ($capture_url,$v[1]); } }
  94. /**
  95. * 儲存單一圖片的方法
  96. *
  97. * @param String $capture_url 用來抓取圖片的網頁位址
  98. * @param String $img_url 需要儲存的圖片的url
  99. *
  100. */
  101. public function save_one_img($capture_url,$img_url)
  102. {
  103. //圖片路徑位址
  104. if ( strpos($img_url, ' http://')!==false )
  105. {
  106. // $img_url = $img_url;
  107. }else
  108. {
  109. $domain_url = substr($capture_url, 0,strpos( $capture_url, '/',8)+1);
  110. $img_url=$domain_url.$img_url;
  111. }
  112. $pathinfo = pathinfo($img_url); //取得圖片路徑資訊
  113. $pic_name=$pathinfo['basename']; //取得圖片的名稱
  114. if (file_exists($this->save_path.$pic_name)) //如果圖片存在,證明已經被抓取過,退出函數
  115. {
  116. echo $img_url . '該圖片已經抓取過!
    ';
  117. return;
  118. }
  119. //將圖片內容讀入一個字串
  120. $img_data = @file_get_contents($img_url); //屏蔽掉因為圖片位址無法讀取導致的warning錯誤
  121. if ( strlen( $img_data) > $this->img_size ) //下載size比限制大的圖片
  122. {
  123. $img_size = file_put_contents($this->save_path . $pic_name, $img_data);
  124. if ($ img_size)
  125. {
  126. echo $img_url . '圖片儲存成功!
    ';
  127. } else
  128. {
  129. echo $img_url . '圖片儲存失敗!
    ';
  130. }
  131. } else
  132. {
  133. echo $img_url . '圖片讀取失敗!
    ';
  134. }
  135. }
  136. } // END
  137. set_time_limit(120); //設定腳本的最大執行時間依情況設定
  138. $download_img=new download_image('E:/images/',0); //實例化下載圖片物件
  139. $download_img->recursive_download_images('http://bbs.it-home.org/'); //遞迴抓取圖片方法
  140. //$download_img->download_current_page_images( $_POST['capture_url']); //只抓取目前頁面圖片方法
  141. ?>
複製程式碼


本網站聲明
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn

熱AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover

AI Clothes Remover

用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool

Undress AI Tool

免費脫衣圖片

Clothoff.io

Clothoff.io

AI脫衣器

Video Face Swap

Video Face Swap

使用我們完全免費的人工智慧換臉工具,輕鬆在任何影片中換臉!

熱工具

記事本++7.3.1

記事本++7.3.1

好用且免費的程式碼編輯器

SublimeText3漢化版

SublimeText3漢化版

中文版,非常好用

禪工作室 13.0.1

禪工作室 13.0.1

強大的PHP整合開發環境

Dreamweaver CS6

Dreamweaver CS6

視覺化網頁開發工具

SublimeText3 Mac版

SublimeText3 Mac版

神級程式碼編輯軟體(SublimeText3)

會話如何劫持工作,如何在PHP中減輕它? 會話如何劫持工作,如何在PHP中減輕它? Apr 06, 2025 am 12:02 AM

會話劫持可以通過以下步驟實現:1.獲取會話ID,2.使用會話ID,3.保持會話活躍。在PHP中防範會話劫持的方法包括:1.使用session_regenerate_id()函數重新生成會話ID,2.通過數據庫存儲會話數據,3.確保所有會話數據通過HTTPS傳輸。

在PHP API中說明JSON Web令牌(JWT)及其用例。 在PHP API中說明JSON Web令牌(JWT)及其用例。 Apr 05, 2025 am 12:04 AM

JWT是一種基於JSON的開放標準,用於在各方之間安全地傳輸信息,主要用於身份驗證和信息交換。 1.JWT由Header、Payload和Signature三部分組成。 2.JWT的工作原理包括生成JWT、驗證JWT和解析Payload三個步驟。 3.在PHP中使用JWT進行身份驗證時,可以生成和驗證JWT,並在高級用法中包含用戶角色和權限信息。 4.常見錯誤包括簽名驗證失敗、令牌過期和Payload過大,調試技巧包括使用調試工具和日誌記錄。 5.性能優化和最佳實踐包括使用合適的簽名算法、合理設置有效期、

描述紮實的原則及其如何應用於PHP的開發。 描述紮實的原則及其如何應用於PHP的開發。 Apr 03, 2025 am 12:04 AM

SOLID原則在PHP開發中的應用包括:1.單一職責原則(SRP):每個類只負責一個功能。 2.開閉原則(OCP):通過擴展而非修改實現變化。 3.里氏替換原則(LSP):子類可替換基類而不影響程序正確性。 4.接口隔離原則(ISP):使用細粒度接口避免依賴不使用的方法。 5.依賴倒置原則(DIP):高低層次模塊都依賴於抽象,通過依賴注入實現。

在PHPStorm中如何進行CLI模式的調試? 在PHPStorm中如何進行CLI模式的調試? Apr 01, 2025 pm 02:57 PM

在PHPStorm中如何進行CLI模式的調試?在使用PHPStorm進行開發時,有時我們需要在命令行界面(CLI)模式下調試PHP�...

如何在系統重啟後自動設置unixsocket的權限? 如何在系統重啟後自動設置unixsocket的權限? Mar 31, 2025 pm 11:54 PM

如何在系統重啟後自動設置unixsocket的權限每次系統重啟後,我們都需要執行以下命令來修改unixsocket的權限:sudo...

解釋PHP中的晚期靜態綁定(靜態::)。 解釋PHP中的晚期靜態綁定(靜態::)。 Apr 03, 2025 am 12:04 AM

靜態綁定(static::)在PHP中實現晚期靜態綁定(LSB),允許在靜態上下文中引用調用類而非定義類。 1)解析過程在運行時進行,2)在繼承關係中向上查找調用類,3)可能帶來性能開銷。

如何用PHP的cURL庫發送包含JSON數據的POST請求? 如何用PHP的cURL庫發送包含JSON數據的POST請求? Apr 01, 2025 pm 03:12 PM

使用PHP的cURL庫發送JSON數據在PHP開發中,經常需要與外部API進行交互,其中一種常見的方式是使用cURL庫發送POST�...

See all articles