php 匹配博客目录里的文章链接
最近在写爬虫练手,但是发现匹配出来数据很少
以博客园为例,这个是我的正则
<code>/http\:\/\/www\.cnblogs\.com\/' . $name . '\/[^\" ]+.html/i </code>
然后匹配这位同学:http://www.cnblogs.com/hoojo/default.html?page=1
发现只有42条数据,但是这位同学明显不止42篇文章,请问如何优化我的正则
回复内容:
最近在写爬虫练手,但是发现匹配出来数据很少
以博客园为例,这个是我的正则
<code>/http\:\/\/www\.cnblogs\.com\/' . $name . '\/[^\" ]+.html/i </code>
然后匹配这位同学:http://www.cnblogs.com/hoojo/default.html?page=1
发现只有42条数据,但是这位同学明显不止42篇文章,请问如何优化我的正则
首先,你这个http://www.cnblogs.com/hoojo/default.html?page=1 只是第一页,第一页好像只有这么多篇文章吧?http://www.cnblogs.com/hoojo/default.html?page=2 是第二页。
首先,你要确定他的博客里面有多少页。你就从第二页http://www.cnblogs.com/hoojo/default.html?page=2 取它的总页数共6页: 上一页 1 2 3 4 5 6
,再在你原来的代码外面加个 for 循环
http://www.cnblogs.com/hoojo/default.html?page={$page_number}
这样就好了。
不太懂您的正则写法。
我数了下第一页一共50条文章,然后我是这么实现的:
<code><?php $aa = file_get_contents('http://www.cnblogs.com/hoojo/default.html?page=1'); preg_match_all ("|class=\"postTitle2\" href=\"(.*)\">|i", $aa, $m); var_dump($m[1]); </code>
这样的结果就是文章链接数组了。
在测试过程中发现文章作者会把其他文章链接写在摘要里,并且被显示。所以您的方法会把摘要内的链接也读出来。
我这里是用文章原文链接的特性获取到的链接。
希望能够帮到你。

Outils d'IA chauds

Undresser.AI Undress
Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover
Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool
Images de déshabillage gratuites

Clothoff.io
Dissolvant de vêtements AI

AI Hentai Generator
Générez AI Hentai gratuitement.

Article chaud

Outils chauds

Bloc-notes++7.3.1
Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise
Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1
Puissant environnement de développement intégré PHP

Dreamweaver CS6
Outils de développement Web visuel

SublimeText3 version Mac
Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Sujets chauds

Dans ce chapitre, nous comprendrons les variables d'environnement, la configuration générale, la configuration de la base de données et la configuration de la messagerie dans CakePHP.

PHP 8.4 apporte plusieurs nouvelles fonctionnalités, améliorations de sécurité et de performances avec une bonne quantité de dépréciations et de suppressions de fonctionnalités. Ce guide explique comment installer PHP 8.4 ou mettre à niveau vers PHP 8.4 sur Ubuntu, Debian ou leurs dérivés. Bien qu'il soit possible de compiler PHP à partir des sources, son installation à partir d'un référentiel APT comme expliqué ci-dessous est souvent plus rapide et plus sécurisée car ces référentiels fourniront les dernières corrections de bogues et mises à jour de sécurité à l'avenir.

Pour travailler avec la date et l'heure dans cakephp4, nous allons utiliser la classe FrozenTime disponible.

Pour travailler sur le téléchargement de fichiers, nous allons utiliser l'assistant de formulaire. Voici un exemple de téléchargement de fichiers.

Dans ce chapitre, nous allons apprendre les sujets suivants liés au routage ?

CakePHP est un framework open source pour PHP. Il vise à faciliter grandement le développement, le déploiement et la maintenance d'applications. CakePHP est basé sur une architecture de type MVC à la fois puissante et facile à appréhender. Modèles, vues et contrôleurs gu

Visual Studio Code, également connu sous le nom de VS Code, est un éditeur de code source gratuit – ou environnement de développement intégré (IDE) – disponible pour tous les principaux systèmes d'exploitation. Avec une large collection d'extensions pour de nombreux langages de programmation, VS Code peut être c

Le validateur peut être créé en ajoutant les deux lignes suivantes dans le contrôleur.
