Rumah pembangunan bahagian belakang tutorial php Menggunakan PHP dan Selenium untuk melaksanakan pengumpulan data perangkak

Menggunakan PHP dan Selenium untuk melaksanakan pengumpulan data perangkak

Jun 16, 2023 pm 12:15 PM
php reptilia selenium

Dengan perkembangan teknologi Internet yang berterusan, data telah menjadi sumber yang sangat berharga Semakin banyak syarikat mula memberi perhatian kepada nilai data dan meningkatkan daya saing mereka melalui perlombongan dan analisis data. Dalam proses ini, pengumpulan data menjadi langkah pertama dalam analisis data.

Pada masa ini, teknologi perangkak ialah kaedah pengumpulan data yang sangat biasa. Teknologi crawler boleh digunakan untuk mendapatkan pelbagai data secara berkesan di Internet, seperti maklumat produk, siaran forum, artikel berita, dsb. di beberapa tapak web. Dalam artikel ini, kami akan memperkenalkan cara menggunakan PHP dan Selenium untuk melaksanakan pengumpulan data perangkak.

1. Apakah itu Selenium?

Selenium ialah alat untuk menguji aplikasi web Ia menyokong berbilang penyemak imbas, termasuk Chrome, Firefox, IE, dll. Selenium boleh mengautomasikan operasi penyemak imbas di Web, seperti mengklik pautan, memasukkan data ke dalam kotak teks, menyerahkan borang dan banyak lagi.

Dalam pengumpulan data, Selenium boleh digunakan untuk mensimulasikan operasi penyemak imbas pada halaman web, dengan itu mencapai pengumpulan data. Secara umumnya, langkah-langkah untuk mengumpul data adalah seperti berikut:

  1. Gunakan Selenium untuk membuka halaman web yang akan dikumpul
  2. Lakukan operasi pada halaman web, seperti memasukkan data ke dalam kotak teks , mengklik butang, dll. Tunggu
  3. untuk mendapatkan data yang diperlukan

2. Gunakan PHP untuk memanggil Selenium

Selenium sendiri ditulis dalam Java, jadi kami perlu menulis skrip Selenium dalam Java Kemudian memanggilnya menggunakan PHP.

  1. Pasang Java dan Selenium

Mula-mula, kita perlu memasang Java dan Selenium. Di sini, kami mengambil Ubuntu sebagai contoh, cuma laksanakan arahan berikut:

sudo apt-get install default-jre

sudo apt-get install default-jdk

Muat turun Pustaka Java Selenium diletakkan dalam direktori projek anda.

  1. Tulis skrip Selenium

Dalam direktori projek, cipta fail bernama selenium.php, dan kemudian tulis skrip Java di dalamnya, seperti kod berikut:

import org.openqa.selenium.WebDriver;
import org.openqa.selenium.chrome.ChromeDriver;

public class SeleniumDemo {
 public static void main(String[] args) {
  System.setProperty("webdriver.chrome.driver", "/path/to/chromedriver"); // chromedriver的路径
  WebDriver driver = new ChromeDriver();
  driver.get("http://www.baidu.com"); // 要访问的网站
  String title = driver.getTitle(); // 获取网页标题
  System.out.println(title);
  driver.quit(); // 退出浏览器
 }
}
Salin selepas log masuk

Skrip ini akan membuka penyemak imbas Chrome dan melawati halaman utama Baidu, kemudian mendapatkan tajuk halaman web dan mengeluarkannya. Anda perlu menggantikan "/path/to/chromedriver" dengan laluan sebenar pada mesin anda.

  1. Memanggil Selenium

Dalam fail selenium.php, gunakan fungsi exec() untuk memanggil skrip Java Kodnya adalah seperti berikut:

rreee

Di sini, fungsi exec() PHP kami digunakan untuk memanggil skrip Java dan "/path/to/selenium-java.jar" perlu diganti dengan laluan sebenar pada mesin anda.

Selepas melaksanakan kod di atas, anda sepatutnya dapat melihat output tajuk halaman web Baidu pada skrin.

3. Gunakan Selenium untuk melaksanakan pengumpulan data

Dengan asas Selenium, kami boleh mula melaksanakan pengumpulan data. Mengambil koleksi data produk Jingdong Mall sebagai contoh, berikut ialah demonstrasi cara menggunakan Selenium untuk melaksanakannya.

  1. Buka halaman web

Mula-mula, kita perlu membuka laman utama JD.com dan mencari produk yang hendak dikumpul. Semasa proses ini, anda perlu memberi perhatian kepada masa memuatkan halaman web Menggunakan fungsi sleep() boleh membuat program berhenti seketika untuk satu tempoh masa dan menunggu halaman web dimuatkan sepenuhnya.

<?php
$output = array();
exec("java -cp .:/path/to/selenium-java.jar SeleniumDemo 2>&1", $output);
$title = $output[0];
echo $title;
?>
Salin selepas log masuk
  1. Dapatkan data produk

Seterusnya, kita perlu mendapatkan data produk dalam hasil carian. Dalam halaman web JD.com, data produk diletakkan dalam div dengan kelas "gl-item". Kita boleh menggunakan findElements() untuk mendapatkan semua elemen div yang layak dan menghuraikan kandungannya satu demi satu.

<?php
$output = array();
exec("java -cp .:/path/to/selenium-java.jar JingDongDemo 2>&1", $output);
echo $output[0]; // 输出采集到的商品数据
?>

// JingDongDemo.java

import org.openqa.selenium.By;
import org.openqa.selenium.WebDriver;
import org.openqa.selenium.WebElement;
import org.openqa.selenium.firefox.FirefoxDriver;
import java.util.List;
import java.util.concurrent.TimeUnit;

public class JingDongDemo {

 public static void main(String[] args) {
  System.setProperty("webdriver.gecko.driver", "/path/to/geckodriver"); // geckodriver的路径
  WebDriver driver = new FirefoxDriver();
  driver.manage().timeouts().implicitlyWait(10, TimeUnit.SECONDS); // 等待网页加载
  driver.get("http://www.jd.com"); // 打开网站
  driver.findElement(By.id("key")).sendKeys("Iphone 7"); // 输入要搜索的商品
  driver.findElement(By.className("button")).click(); // 单击搜索按钮
  try {
   Thread.sleep(5000); // 等待网页完全加载
  } catch (InterruptedException e) {
   e.printStackTrace();
  }
 }
}
Salin selepas log masuk

Pada ketika ini, kami telah berjaya melaksanakan pengumpulan data perangkak menggunakan PHP dan Selenium. Sudah tentu, terdapat banyak perkara yang perlu diberi perhatian semasa proses pengumpulan data sebenar, seperti strategi anti-crawler tapak web, penyemak imbas dan keserasian versi Selenium, dsb. Saya harap artikel ini dapat memberi sedikit rujukan kepada rakan-rakan yang memerlukan pengumpulan data.

Atas ialah kandungan terperinci Menggunakan PHP dan Selenium untuk melaksanakan pengumpulan data perangkak. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan Laman Web ini
Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Alat AI Hot

Undresser.AI Undress

Undresser.AI Undress

Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover

AI Clothes Remover

Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool

Undress AI Tool

Gambar buka pakaian secara percuma

Clothoff.io

Clothoff.io

Penyingkiran pakaian AI

AI Hentai Generator

AI Hentai Generator

Menjana ai hentai secara percuma.

Artikel Panas

R.E.P.O. Kristal tenaga dijelaskan dan apa yang mereka lakukan (kristal kuning)
3 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. Tetapan grafik terbaik
3 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. Cara Memperbaiki Audio Jika anda tidak dapat mendengar sesiapa
3 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌
WWE 2K25: Cara Membuka Segala -galanya Di Myrise
3 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌

Alat panas

Notepad++7.3.1

Notepad++7.3.1

Editor kod yang mudah digunakan dan percuma

SublimeText3 versi Cina

SublimeText3 versi Cina

Versi Cina, sangat mudah digunakan

Hantar Studio 13.0.1

Hantar Studio 13.0.1

Persekitaran pembangunan bersepadu PHP yang berkuasa

Dreamweaver CS6

Dreamweaver CS6

Alat pembangunan web visual

SublimeText3 versi Mac

SublimeText3 versi Mac

Perisian penyuntingan kod peringkat Tuhan (SublimeText3)

Panduan Pemasangan dan Naik Taraf PHP 8.4 untuk Ubuntu dan Debian Panduan Pemasangan dan Naik Taraf PHP 8.4 untuk Ubuntu dan Debian Dec 24, 2024 pm 04:42 PM

PHP 8.4 membawa beberapa ciri baharu, peningkatan keselamatan dan peningkatan prestasi dengan jumlah penamatan dan penyingkiran ciri yang sihat. Panduan ini menerangkan cara memasang PHP 8.4 atau naik taraf kepada PHP 8.4 pada Ubuntu, Debian, atau terbitan mereka

CakePHP Bekerja dengan Pangkalan Data CakePHP Bekerja dengan Pangkalan Data Sep 10, 2024 pm 05:25 PM

Bekerja dengan pangkalan data dalam CakePHP adalah sangat mudah. Kami akan memahami operasi CRUD (Buat, Baca, Kemas Kini, Padam) dalam bab ini.

Tarikh dan Masa CakePHP Tarikh dan Masa CakePHP Sep 10, 2024 pm 05:27 PM

Untuk bekerja dengan tarikh dan masa dalam cakephp4, kami akan menggunakan kelas FrozenTime yang tersedia.

Muat naik Fail CakePHP Muat naik Fail CakePHP Sep 10, 2024 pm 05:27 PM

Untuk mengusahakan muat naik fail, kami akan menggunakan pembantu borang. Di sini, adalah contoh untuk muat naik fail.

Bincangkan CakePHP Bincangkan CakePHP Sep 10, 2024 pm 05:28 PM

CakePHP ialah rangka kerja sumber terbuka untuk PHP. Ia bertujuan untuk menjadikan pembangunan, penggunaan dan penyelenggaraan aplikasi lebih mudah. CakePHP adalah berdasarkan seni bina seperti MVC yang berkuasa dan mudah difahami. Model, Pandangan dan Pengawal gu

Pengesah Mencipta CakePHP Pengesah Mencipta CakePHP Sep 10, 2024 pm 05:26 PM

Pengesah boleh dibuat dengan menambah dua baris berikut dalam pengawal.

Pembalakan CakePHP Pembalakan CakePHP Sep 10, 2024 pm 05:26 PM

Log masuk CakePHP adalah tugas yang sangat mudah. Anda hanya perlu menggunakan satu fungsi. Anda boleh log ralat, pengecualian, aktiviti pengguna, tindakan yang diambil oleh pengguna, untuk sebarang proses latar belakang seperti cronjob. Mengelog data dalam CakePHP adalah mudah. Fungsi log() disediakan

Cara Menyediakan Kod Visual Studio (Kod VS) untuk Pembangunan PHP Cara Menyediakan Kod Visual Studio (Kod VS) untuk Pembangunan PHP Dec 20, 2024 am 11:31 AM

Kod Visual Studio, juga dikenali sebagai Kod VS, ialah editor kod sumber percuma — atau persekitaran pembangunan bersepadu (IDE) — tersedia untuk semua sistem pengendalian utama. Dengan koleksi sambungan yang besar untuk banyak bahasa pengaturcaraan, Kod VS boleh menjadi c

See all articles