ホームページ Java &#&チュートリアル JavaScript Web サイトを効率的にスクレイピングする

JavaScript Web サイトを効率的にスクレイピングする

Nov 20, 2024 am 01:12 AM

Effizientes Scrapen von JavaScript-Webseiten

Web クローリングに JavaScript を使用する可能性

静的 Web サイト: Axios と Cheerio
JavaScript を使用して静的 e コマース Web サイトをクロールする手順を見てみましょう。この例では、HTTP リクエスト用の Axios と HTML 解析用の Cheerio という 2 つの一般的なライブラリを使用します。

*1.依存関係をインストールします *
npm:

を使用して Axios と Cheerio をインストールします。 npm install axios Cherio

*2.スクリプトの作成 *
JavaScript ファイルを作成します。 B.Ecommerce.js をスクレイピングし、コード エディターで開きます。

*3.モジュールのインポート *
Axios と Cheerio をスクリプトにインポートします:

const axios = require('axios');

const チェリオ = require('チェリオ');

*4.ターゲット URL を定義 *
アクセスしたい電子商取引 Web サイトを選択します。この例では、仮想 URL http://example-ecommerce.com を使用します。これを目的の URL に置き換えます:

const url = 'http://example-ecommerce.com';

*5. HTML コンテンツを取得 *
Axios を使用して、ターゲット URL に GET リクエストを送信し、HTML コンテンツを取得します:

axios.get(url)

.then(response => {

const html = 応答.データ;

// HTML コンテンツを解析できるようになりました

})

.catch(error => {

console.error('ページの取得エラー:', error);

});

*6. HTML を解析してデータを抽出します *
Cheerio を使用して HTML コードを解析し、製品名や価格などの必要な情報を抽出します:

axios.get(url)

.then(response => {

const html = 応答.データ;

const $ = Cheerio.load(html);

const products = [];  

$('.product').each((index, element) => {  
  const name = $(element).find('.product-name').text().trim();  
  const price = $(element).find('.product-price').text().trim();  
  products.push({ name, price });  
});  

console.log(products);  
ログイン後にコピー
ログイン後にコピー

})

.catch(error => {

console.error('ページの取得エラー:', error);

});

*最重要ポイント*

  • axios.get(url): GET リクエストを送信し、Promise を返します。
  • .then(response => { … }): リクエストが成功した場合、HTML コンテンツは response.data にあります。
  • cheerio.load(html): DOM を jQuery のように操作するために、HTML コンテンツを Cheerio にロードします。
  • $('.product').each((index, element) => { … }): すべての .product 要素を反復処理します。
  • $(element).find('.product-name').text().trim(): 製品名を抽出します。
  • $(element).find('.product-price').text().trim(): 商品の価格を抽出します。
  • products.push({ name, Price }): 製品情報を products 配列に追加します。
  • console.log(products): 抽出した情報を出力します。

*完全なスクリプト例: *
const axios = require('axios');

const チェリオ = require('チェリオ');

const url = 'http://example-ecommerce.com';

axios.get(url)

.then(response => {

const html = 応答.データ;

const $ = Cheerio.load(html);

const products = [];  

$('.product').each((index, element) => {  
  const name = $(element).find('.product-name').text().trim();  
  const price = $(element).find('.product-price').text().trim();  
  products.push({ name, price });  
});  

console.log(products);  
ログイン後にコピー
ログイン後にコピー

})

.catch(error => {

console.error('ページの取得エラー:', error);

});

*ランディング ページのカスタマイズ: *

  • セレクター: .product、.product-name、および .product-price セレクターは、ターゲット ページの実際の HTML 構造に適合させる必要があります。
  • 追加データ: 追加情報 (製品画像、リンク、説明など) については、対応する HTML 構造を確認してください。

JavaScriptを使用してWebサイトをスクレイピングするWebスクレイピングツール

最近、Web スクレイピングに Python、Ruby、または別のプログラミング言語が必要になった場合、Octoparse は、特に JavaScript をサポートする Web サイトにとって優れたツールです。

具体的な例を見てみましょう: 対象の Web サイトがあり、スクレイピングを開始したい場合は、まずそのサイトが JS スクレイピングに対してブロックされているかどうかを確認する必要があります。 Web サイトごとに使用する保護方法が異なるため、特にスクレイピングで期待どおりの結果が得られない場合、何かが間違っていることに気づくまでに時間がかかり、イライラする試行が必要になる場合があります。ただし、Web スクレイピング ツールを使用すると、データ抽出プロセスがスムーズに進みます。

多くの Web スクレイピング ツールは、クローラーを作成する手間を省きます。 Octoparse は、JavaScript の多いページをスクレイピングする際に特に効率的であり、Ajax を使用するページを含む Web ページの 99% からデータを抽出できます。キャプチャ解決サービスも提供します。 Octoparse は無料で使用でき、自動検出機能と、効率的なデータ抽出を可能にする 100 を超える使いやすいテンプレートを提供します。新規ユーザーも 14 日間のトライアルを利用できます。

以上がJavaScript Web サイトを効率的にスクレイピングするの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

このウェブサイトの声明
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

ホットAIツール

Undresser.AI Undress

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

Undress AI Tool

脱衣画像を無料で

Clothoff.io

Clothoff.io

AI衣類リムーバー

Video Face Swap

Video Face Swap

完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

ホットツール

メモ帳++7.3.1

メモ帳++7.3.1

使いやすく無料のコードエディター

SublimeText3 中国語版

SublimeText3 中国語版

中国語版、とても使いやすい

ゼンドスタジオ 13.0.1

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

ドリームウィーバー CS6

ドリームウィーバー CS6

ビジュアル Web 開発ツール

SublimeText3 Mac版

SublimeText3 Mac版

神レベルのコード編集ソフト(SublimeText3)

会社のセキュリティソフトウェアはアプリケーションの実行に失敗していますか?それをトラブルシューティングと解決する方法は? 会社のセキュリティソフトウェアはアプリケーションの実行に失敗していますか?それをトラブルシューティングと解決する方法は? Apr 19, 2025 pm 04:51 PM

一部のアプリケーションが適切に機能しないようにする会社のセキュリティソフトウェアのトラブルシューティングとソリューション。多くの企業は、内部ネットワークセキュリティを確保するためにセキュリティソフトウェアを展開します。 ...

名前を数値に変換してソートを実装し、グループの一貫性を維持するにはどうすればよいですか? 名前を数値に変換してソートを実装し、グループの一貫性を維持するにはどうすればよいですか? Apr 19, 2025 pm 11:30 PM

多くのアプリケーションシナリオでソートを実装するために名前を数値に変換するソリューションでは、ユーザーはグループ、特に1つでソートする必要がある場合があります...

MapsTructを使用したシステムドッキングのフィールドマッピングの問題を簡素化する方法は? MapsTructを使用したシステムドッキングのフィールドマッピングの問題を簡素化する方法は? Apr 19, 2025 pm 06:21 PM

システムドッキングでのフィールドマッピング処理は、システムドッキングを実行する際に難しい問題に遭遇することがよくあります。システムのインターフェイスフィールドを効果的にマッピングする方法A ...

Intellijのアイデアは、ログを出力せずにSpring Bootプロジェクトのポート番号をどのように識別しますか? Intellijのアイデアは、ログを出力せずにSpring Bootプロジェクトのポート番号をどのように識別しますか? Apr 19, 2025 pm 11:45 PM

intellijideaultimatiateバージョンを使用してスプリングを開始します...

エンティティクラス変数名をエレガントに取得して、データベースクエリ条件を構築する方法は? エンティティクラス変数名をエレガントに取得して、データベースクエリ条件を構築する方法は? Apr 19, 2025 pm 11:42 PM

データベース操作にMyBatis-Plusまたはその他のORMフレームワークを使用する場合、エンティティクラスの属性名に基づいてクエリ条件を構築する必要があることがよくあります。あなたが毎回手動で...

Javaオブジェクトを配列に安全に変換する方法は? Javaオブジェクトを配列に安全に変換する方法は? Apr 19, 2025 pm 11:33 PM

Javaオブジェクトと配列の変換:リスクの詳細な議論と鋳造タイプ変換の正しい方法多くのJava初心者は、オブジェクトのアレイへの変換に遭遇します...

Redisキャッシュソリューションを使用して、製品ランキングリストの要件を効率的に実現する方法は? Redisキャッシュソリューションを使用して、製品ランキングリストの要件を効率的に実現する方法は? Apr 19, 2025 pm 11:36 PM

Redisキャッシュソリューションは、製品ランキングリストの要件をどのように実現しますか?開発プロセス中に、多くの場合、ランキングの要件に対処する必要があります。

eコマースプラットフォームSKUおよびSPUデータベースデザイン:ユーザー定義の属性と原因のない製品の両方を考慮する方法は? eコマースプラットフォームSKUおよびSPUデータベースデザイン:ユーザー定義の属性と原因のない製品の両方を考慮する方法は? Apr 19, 2025 pm 11:27 PM

eコマースプラットフォーム上のSKUおよびSPUテーブルの設計の詳細な説明この記事では、eコマースプラットフォームでのSKUとSPUのデータベース設計の問題、特にユーザー定義の販売を扱う方法について説明します。

See all articles