目次
回复内容:
ホームページ バックエンド開発 PHPチュートリアル php抓取百度邮编搜索结果,应改如何写正则表达式?

php抓取百度邮编搜索结果,应改如何写正则表达式?

Jun 06, 2016 pm 08:41 PM
php 正規表現

本人小白,想通过百度邮编搜索截取一个地址的邮编,在自己的网站空间里放了个php脚本。
因为要求不是很高,试图通过正则匹配找到第一组“首位不为0的六位数字”,作为结果输出,但是不管怎么尝试,得到的始终是一个空数组……
正则表达式是我从网上找的,也是过不同的形式,但是始终都得不到任何值

<code><?php $final_url = 'http://opendata.baidu.com/post/s?wd=%C9%BD%B6%AB%CA%A1%BC%C3%C4%CF%CA%D0%C0%FA%CF%C2%C7%F8&p=mini&rn=20';
$search_result = file_get_contents($final_url);
$clear_result = strip_tags($search_result);
echo mb_detect_encoding($search_result);
echo("</br>");
echo($clear_result);
echo("");
$zipcodes = search_for_zipcodes($clear_result);
print_r($zipcodes);

function search_for_zipcodes($test) {
    $rule = '/^[1-9]\d{5}$/';
    preg_match_all($rule,$test,$result);
    return $result;
}    ?>
</code>
ログイン後にコピー
ログイン後にコピー

mb_detect_encoding($search_result),写这一句是想看看返回回来的页面的编码,但是这个函数似乎也得不到任何结果……

如果漏洞百出烦请诸位大神耐心指教,本人真的是小白一只……

回复内容:

本人小白,想通过百度邮编搜索截取一个地址的邮编,在自己的网站空间里放了个php脚本。
因为要求不是很高,试图通过正则匹配找到第一组“首位不为0的六位数字”,作为结果输出,但是不管怎么尝试,得到的始终是一个空数组……
正则表达式是我从网上找的,也是过不同的形式,但是始终都得不到任何值

<code><?php $final_url = 'http://opendata.baidu.com/post/s?wd=%C9%BD%B6%AB%CA%A1%BC%C3%C4%CF%CA%D0%C0%FA%CF%C2%C7%F8&p=mini&rn=20';
$search_result = file_get_contents($final_url);
$clear_result = strip_tags($search_result);
echo mb_detect_encoding($search_result);
echo("</br>");
echo($clear_result);
echo("");
$zipcodes = search_for_zipcodes($clear_result);
print_r($zipcodes);

function search_for_zipcodes($test) {
    $rule = '/^[1-9]\d{5}$/';
    preg_match_all($rule,$test,$result);
    return $result;
}    ?>
</code>
ログイン後にコピー
ログイン後にコピー

mb_detect_encoding($search_result),写这一句是想看看返回回来的页面的编码,但是这个函数似乎也得不到任何结果……

如果漏洞百出烦请诸位大神耐心指教,本人真的是小白一只……

题主啊, 你好.

我觉得, 你这个任务, 用不到正则.

为什么呢?

请看里面的搜索结果是什么?

<code>        <table class="table-list" cellspacing="0">
<tr>
<th class="head-postcode">邮编</th>
<th class="head-region">行政区域</th>
</tr>
<tr>
<td>250102</td>
<td>
<em>山东省</em> <em>济南市</em> <em>历下区</em> 经十路双号2218-5150</td>
</tr>
<tr>
<td>250102</td>
<td>
<em>山东省</em> <em>济南市</em> <em>历下区</em> 经十东路双号33188-33688</td>
</tr>
<tr>
<td>250102</td>
<td>
<em>山东省</em> <em>济南市</em> <em>历下区</em> 经十路单号177-3799</td>
</tr>
<tr>
<td>250102</td>
<td>
<em>山东省</em> <em>济南市</em> <em>历下区</em> 旅游路港沟水利站机关公寓</td>
</tr>
</table> 
</code>
ログイン後にコピー

好完整的结果, 这已经是一个列表了.

因为具体还没有看, 一会我来告诉你怎么处理.我先php试一下.

<code>  <?php //有单独邮编的网址
$url = 'http://opendata.baidu.com/post/s?wd=%C9%BD%CE%F7&p=mini&rn=20';  

// 没有单独邮编的网址
//$url= 'http://opendata.baidu.com/post/s?wd=%C9%BD%B6%AB%CA%A1%BC%C3%C4%CF%CA%D0%C0%FA%CF%C2%C7%F8%C6%BD%B0%B2%BA%FA%CD%AC&p=mini&rn=20';


// xpath 解析文档
$dom = new DOMDocument;
libxml_use_internal_errors(TRUE);
$dom->loadHTMLFile($url);
libxml_clear_errors();
$xPath = new DOMXPath($dom);

//起作用的语句
$trs = $xPath->query('//li/a/text()|//tr/td');

//输出结果
foreach($trs as $tr) {
     $str= $tr->nodeValue;

    if(strlen($str)>6){
    $str =  array_pop( explode(' ', $str));

    }
    echo $str;
    break;
}



?>
</code>
ログイン後にコピー

http://phpfiddle.org/

你去phpfiddle 试一下吧, 还行. 做这种工作, xpath方便点.

<code><?php $final_url = 'http://opendata.baidu.com/post/s?wd=%C9%BD%B6%AB%CA%A1%BC%C3%C4%CF%CA%D0%C0%FA%CF%C2%C7%F8&p=mini&rn=20';
$search_result = file_get_contents($final_url);
$search_result = iconv('gbk', 'utf-8', $search_result);
preg_match_all("@<td>(\d+)<td>(.*?)</td>@is", $search_result, $match);
$area = array_map("strip_tags", $match[2]);
print_r($match[1]);
print_r($area);
</code>
ログイン後にコピー

把$rule = '/^[1-9]\d{5}$/';换成
$rule = '/[1-9]\d{5}/';试试
因为,你用了strip_tags.所以,很多内容,都直接合并成“一行”了。再用^,$应该是匹配不到的

このウェブサイトの声明
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

ホットAIツール

Undresser.AI Undress

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

Undress AI Tool

脱衣画像を無料で

Clothoff.io

Clothoff.io

AI衣類リムーバー

AI Hentai Generator

AI Hentai Generator

AIヘンタイを無料で生成します。

ホットツール

メモ帳++7.3.1

メモ帳++7.3.1

使いやすく無料のコードエディター

SublimeText3 中国語版

SublimeText3 中国語版

中国語版、とても使いやすい

ゼンドスタジオ 13.0.1

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

ドリームウィーバー CS6

ドリームウィーバー CS6

ビジュアル Web 開発ツール

SublimeText3 Mac版

SublimeText3 Mac版

神レベルのコード編集ソフト(SublimeText3)

CakePHP プロジェクトの構成 CakePHP プロジェクトの構成 Sep 10, 2024 pm 05:25 PM

この章では、CakePHP の環境変数、一般設定、データベース設定、電子メール設定について理解します。

Ubuntu および Debian 用の PHP 8.4 インストールおよびアップグレード ガイド Ubuntu および Debian 用の PHP 8.4 インストールおよびアップグレード ガイド Dec 24, 2024 pm 04:42 PM

PHP 8.4 では、いくつかの新機能、セキュリティの改善、パフォーマンスの改善が行われ、かなりの量の機能の非推奨と削除が行われています。 このガイドでは、Ubuntu、Debian、またはその派生版に PHP 8.4 をインストールする方法、または PHP 8.4 にアップグレードする方法について説明します。

CakePHP の日付と時刻 CakePHP の日付と時刻 Sep 10, 2024 pm 05:27 PM

Cakephp4 で日付と時刻を操作するには、利用可能な FrozenTime クラスを利用します。

CakePHP ファイルのアップロード CakePHP ファイルのアップロード Sep 10, 2024 pm 05:27 PM

ファイルのアップロードを行うには、フォーム ヘルパーを使用します。ここではファイルアップロードの例を示します。

CakePHP ルーティング CakePHP ルーティング Sep 10, 2024 pm 05:25 PM

この章では、ルーティングに関連する次のトピックを学習します。

CakePHP について話し合う CakePHP について話し合う Sep 10, 2024 pm 05:28 PM

CakePHP は、PHP 用のオープンソース フレームワークです。これは、アプリケーションの開発、展開、保守をより簡単にすることを目的としています。 CakePHP は、強力かつ理解しやすい MVC のようなアーキテクチャに基づいています。モデル、ビュー、コントローラー

PHP 開発用に Visual Studio Code (VS Code) をセットアップする方法 PHP 開発用に Visual Studio Code (VS Code) をセットアップする方法 Dec 20, 2024 am 11:31 AM

Visual Studio Code (VS Code とも呼ばれる) は、すべての主要なオペレーティング システムで利用できる無料のソース コード エディター (統合開発環境 (IDE)) です。 多くのプログラミング言語の拡張機能の大規模なコレクションを備えた VS Code は、

CakePHP バリデータの作成 CakePHP バリデータの作成 Sep 10, 2024 pm 05:26 PM

Validator は、コントローラーに次の 2 行を追加することで作成できます。

See all articles