コミュニティ

学ぶ

ツールライブラリ

AIツール

レジャー

日本語

ホームページ > バックエンド開発 > PHPチュートリアル > javascript - scrpy CrawlSpider自动爬去网页问题

javascript - scrpy CrawlSpider自动爬去网页问题

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

リリース： 2016-06-06 20:17:13

オリジナル

1438 人が閲覧しました

#我的代码如下，问题在代码的注释里面
from scrapy.contrib.linkextractors.sgml import SgmlLinkExtractor as sle #用于定义需要提取的链接
class NewsSpider(CrawlSpider):

<code>name = "demo2"
allowed_domains = ["360.cn"]
# start_urls=["http://bobao.360.cn/activity/index&page=2"]#这个连接测试成功
# rules = [ Rule(sle(allow=r'/vul/index?type=all&page=\d{1,3}'), follow=True,callback='parse_item1') ]#*这个测试不成功原因好像*
#allow=r'/vul/index?type=all&page=\d{1,3} 这个里面/vul/index?这个?有影响,请教如何修改
rules = [ Rule(sle(allow=r'/activity/index&page=\d{1,3}'), follow=True,callback='parse_item1') ]#这个连接测试成功
</code>

ログイン後にコピー

ログイン後にコピー

/activity/index&page=

<code>def parse_item1(self, response):
    print u'这是谁?????????????????????'
    </code>

ログイン後にコピー

ログイン後にコピー

回复内容：

#我的代码如下，问题在代码的注释里面
from scrapy.contrib.linkextractors.sgml import SgmlLinkExtractor as sle #用于定义需要提取的链接
class NewsSpider(CrawlSpider):

<code>name = "demo2"
allowed_domains = ["360.cn"]
# start_urls=["http://bobao.360.cn/activity/index&page=2"]#这个连接测试成功
# rules = [ Rule(sle(allow=r'/vul/index?type=all&page=\d{1,3}'), follow=True,callback='parse_item1') ]#*这个测试不成功原因好像*
#allow=r'/vul/index?type=all&page=\d{1,3} 这个里面/vul/index?这个?有影响,请教如何修改
rules = [ Rule(sle(allow=r'/activity/index&page=\d{1,3}'), follow=True,callback='parse_item1') ]#这个连接测试成功
</code>

ログイン後にコピー

ログイン後にコピー

/activity/index&page=

<code>def parse_item1(self, response):
    print u'这是谁?????????????????????'
    </code>

ログイン後にコピー

ログイン後にコピー

此处要注意?号的转换，复制过来需要对?号进行转义。

网页中链接是这样：#/rwxwsblog/default.html?page=3"
要写成这样的：Rule(sle(allow=("/rwxwsblog/default.html\?page=\d{1,}")), #此处要注意?号的转换，复制过来需要对?号进行转义。

関連ラベル：

c++ java javascript php python

前の記事：文章表500万条数据，每天会有10万条数据更新，从更新的10万条中随机选3000条做数据研究，如果做到高效？次の記事：我有个点赞功能的逻辑实现，性能优化，高并发的问题想问

このウェブサイトの声明

この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

著者別の最新記事

LLMSの仕組み：トレーニング後、ニューラルネットワーク、幻覚、推論への事前トレーニング

2025-02-26 03:58:14
ブロックチェーンとAIを組み合わせてアートを生成しました。次に何が起こったのか。

2025-02-26 03:38:10
高度なプロンプトエンジニアリング：思考チェーン（COT）

2025-02-26 03:17:10
SQLiteでの検索拡張生成

2025-02-26 02:49:09
独自のnode.js APIを構築するためにLLM駆動のボイラープレートを使用する方法

2025-02-26 01:08:13
2024年のコーディングのためのLLMS：価格、パフォーマンス、そして最高の戦い

2025-02-26 00:46:10
ビジョン言語モデルを促します

2025-02-25 23:42:08
大手言語モデルの応答の信頼性を測定する方法

2025-02-25 22:50:13
人生の幻想

2025-02-25 21:54:11
科学者は人間の思考を反映する大きな言語モデルに真剣に取り組む

2025-02-25 20:45:11

最新の問題

cakephpとは何ですか？なぜそれを使うのですか？

2025-03-18 17:12:12
GDPR PHPコンプライアンス：Webアプリケーション用のGDPRの維持

2025-03-14 11:44:41
PHPのカール：REST APIでPHPカール拡張機能を使用する方法

2025-03-14 11:42:06
PHPでカスタムキャプチャと連絡フォームを作成します

2025-03-14 11:06:10
Codecanyonで12の最高のPHPチャットスクリプト

2025-03-13 12:08:12

関連トピック

詳細>

人気のおすすめ

人気のチュートリアル

詳細>

関連するチュートリアル

人気のおすすめ

最新のコース

最新のダウンロード

詳細>

ウェブエフェクト

公式サイト

サイト素材

フロントエンドテンプレート