javascript - scrpy CrawlSpider自动爬去网页问题

Question

#我的代码如下，问题在代码的注释里面from scrapy.contrib.linkextractors.sgml import SgmlLinkExtractor as sle #用于定义需要提取的链接class NewsSpider(CrawlSpider): {代码...} /activity/index&amp;page= ...

天蓬老师 · Answer

此处要注意?号的转换，复制过来需要对?号进行转义。

网页中链接是这样：#/rwxwsblog/default.html?page=3"
要写成这样的：Rule(sle(allow=("/rwxwsblog/default.html\?page=\d{1,}")), #此处要注意?号的转换，复制过来需要对?号进行转义。