PHP は Zhihu ユーザー データのクロールと分析を実装します、php_PHP チュートリアル
Jul 12, 2016 am 08:59 AMphp は、Zhihu ユーザー データのクロールと分析を実装します。php
背景の説明: Xiaoyan は、実験的に 50,000 人の Zhihu ユーザーの基本情報を同時にクロールするために、php のcurl で作成されたクローラーを使用しました。データは簡単に分析されます。そして提示されました。
php スパイダー コードとユーザー ダッシュボードの表示コードは分類されて github にアップロードされ、コード ベースは個人のブログや公開アカウントで更新されます。このプログラムは、Zhihu 関連の権利と利益を侵害する場合にのみ使用されます。 、削除する場合はできるだけ早くご連絡ください。
写真も真実もありません
モバイル分析データのスクリーンショット
PC側解析データのスクリーンショット
全体のクローリング、分析、表示のプロセスは大きく次のステップに分かれており、Xiaoyan がそれぞれについて紹介します
- curlはZhihuのWebページデータをクロールします
- Zhihuウェブページデータの定期分析
- データストレージとプログラムの展開
- データ分析とプレゼンテーション
curlはWebデータをクロールします
PHP 用のカール拡張機能は、さまざまなタイプのプロトコルを使用してさまざまなサーバーに接続して通信できるようにする、PHP でサポートされているライブラリです。 Webページをクロールするのに非常に便利なツールであり、同時にマルチスレッド拡張もサポートしています。
このプログラムは、Zhihu がユーザーにアクセスを提供する個人情報ページ https://www.zhihu.com/people/xxx をキャプチャします。クロール プロセスでは、ページを取得するためにユーザーの Cookie が必要です。直接コードを書く
ページの Cookie を取得します
コードをコピーします コードは次のとおりです:
// Zhihu にログインし、パーソナル センターを開いて、コンソールを開いて、Cookie を取得します
ドキュメント.クッキー
"_za=67254197-3wwb8d-43f6-94f0-fb0e2d521c31; _ga=GA1.2.2142818188.1433767929; q_c1=78ee1604225d47d08cddd8142a08288b23|1452172601 |1452172601000; _xsrf=15f0639cbe6fb607560c075269064393; cap_id="N2QwMTExNGQ0YTY2NGVddlMGIyNmQ4NjdjOTU0YTM5MmQ=|1453444256|49fdc6b43dc51f 702b7 d6575451e228f56cdaf5d"; __utmt=1; lock_ticket = "QUJDTWpmM0lsZdd2dYQUFBQVlRSlZUVTNVb1ZaNDVoQXJlblVmWGJ0WGwyaHlDdVdscXdZU1VRPT0=|1453444421|c47a2afde1ff334d416bafb1cc267b41014c9d5f"; 54 390.21428dd18188.1433767929.1453187421.1453444257.3; __utmb=51854390.14.8.1453444425011; __utmc=51854390.14528 46679 .1.dd1.utmcsr=google|utmccn=(オーガニック)|utmcmd =organic| utmctr=(%20 が提供されていません); __utmv=51854390.100-1|2=登録日=20150823=1^dd3=エントリ日=20150823=1"
個人センターページをキャッチ
リーリー
さらなるクロールのための Web ページデータと新しいリンクの定期的な分析
クロールされた Web ページを保存します。。 Zhihu ページの分析を通じて、個人センター ページにはフォロワーと「いいね!」をした人やフォローしている人がいることがわかりました。 要想进行进一步的爬取,页面必须包含有可用于进一步爬取用户的链接
以下に示すように
コードをコピーします コードは次のとおりです:
// クロールされた HTML ページで新しいユーザーが見つかり、クローラーに使用できます
<a class="zm-item-link-avatar avatar-link" href="/people/new-user" data-tip="p$t$new-user">
コードをコピーします コードは次のとおりです:
// クロールされたページに一致するすべてのユーザーと一致します
preg_match_all('//people/([w-]+)"/i', $str, $match_arr);
//重複を削除して新しいユーザー配列にマージすると、ユーザーはさらにクロールできるようになります
self::$newUserArr = array_unique(array_merge($match_arr[1], self::$newUserArr));
大量のデータをクロールする必要がある場合は、マルチスレッド高速クロールの
を検討できますが、ここでは説明しません。 curl_multi
和pcntl
ユーザーデータを分析し、分析を提供します
正規表現を使用すると、さらに多くのユーザー データと照合し、それを直接コーディングできます。リーリー
クロール プロセス中、可能であれば、Redis を介してデータベースに入る必要があります。これにより、クロールとウェアハウスの効率が実際に向上します。条件がない場合は、SQL を通じてのみ最適化できます。ここにいくつかの考えがあります。データベーステーブルのインデックスを設計するときは注意してください。スパイダー クローリングのプロセスでは、ユーザー名にインデックスを付けず、主キーを含む左右のフィールドにインデックスを付けないことをお勧めします。
毎回 1 つずつ追加する 5,000 万のデータを想像してください。インデックスを作成するために必要です。クロールが完了し、データを分析する必要があると、インデックスがバッチで作成されます。 尽可能的提高入库效率
リーリー
展開操作。クローリング処理中にプログラムが異常ハングする場合がありますので、効率と安定性を確保するために、可能な限りタイミングスクリプトを作成してください。時々異常終了しても、貴重な時間を無駄にしないように、時々強制終了して再実行してください。
#!/bin/bash # 干掉 ps aux |grep spider |awk '{print $2}'|xargs kill -9 sleep 5s # 重新跑 nohup /home/cuixiaohuan/lamp/php5/bin/php /home/cuixiaohuan/php/zhihu_spider/spider_new.php &
数据分析呈现
数据的呈现主要使用echarts 3.0,感觉对于移动端兼容还不错。兼容移动端的页面响应式布局主要通过几个简单的css控制,代码如下
// 获取用户头像 preg_match('/<img.+src=\"?([^\s]+\.(jpg|gif|bmp|bnp|png))\"?.+>/i', $str, $match_img); $img_url = $match_img[1]; // 匹配用户名: // <span class="name">崔小拽</span> preg_match('/<span.+class=\"?name\"?>([\x{4e00}-\x{9fa5}]+).+span>/u', $str, $match_name); $user_name = $match_name[1]; // 匹配用户简介 // class bio span 中文 preg_match('/<span.+class=\"?bio\"?.+\>([\x{4e00}-\x{9fa5}]+).+span>/u', $str, $match_title); $user_title = $match_title[1]; // 匹配性别 //<input type="radio" name="gender" value="1" checked="checked" class="male"/> 男 // gender value1 ;结束 中文 preg_match('/<input.+name=\"?gender\"?.+value=\"?1\"?.+([\x{4e00}-\x{9fa5}]+).+\;/u', $str, $match_sex); $user_sex = $match_sex[1]; // 匹配地区 //<span class="location item" title="北京"> preg_match('/<span.+class=\"?location.+\"?.+\"([\x{4e00}-\x{9fa5}]+)\">/u', $str, $match_city); $user_city = $match_city[1]; // 匹配工作 //<span class="employment item" title="人见人骂的公司">人见人骂的公司</span> preg_match('/<span.+class=\"?employment.+\"?.+\"([\x{4e00}-\x{9fa5}]+)\">/u', $str, $match_employment); $user_employ = $match_employment[1]; // 匹配职位 // <span class="position item" title="程序猿"><a href="/topic/19590046" title="程序猿" class="topic-link" data-token="19590046" data-topicid="13253">程序猿</a></span> preg_match('/<span.+class=\"?position.+\"?.+\"([\x{4e00}-\x{9fa5}]+).+\">/u', $str, $match_position); $user_position = $match_position[1]; // 匹配学历 // <span class="education item" title="研究僧">研究僧</span> preg_match('/<span.+class=\"?education.+\"?.+\"([\x{4e00}-\x{9fa5}]+)\">/u', $str, $match_education); $user_education = $match_education[1]; // 工作情况 // <span class="education-extra item" title='挨踢'>挨踢</span> preg_match('/<span.+class=\"?education-extra.+\"?.+>([\x{4e00}- \x{9fa5}]+)</u', $str, $match_education_extra); $user_education_extra = $match_education_extra[1]; // 匹配关注话题数量 // class="zg-link-litblue"><strong>41 个话题</strong></a> preg_match('/class=\"?zg-link-litblue\"?><strong>(\d+)\s.+strong>/i', $str, $match_topic); $user_topic = $match_topic[1]; // 关注人数 // <span class="zg-gray-normal">关注了 preg_match_all('/<strong>(\d+)<.+<label>/i', $str, $match_care); $user_care = $match_care[1][0]; $user_be_careed = $match_care[1][1]; // 历史浏览量 // <span class="zg-gray-normal">个人主页被 <strong>17</strong> 人浏览</span> preg_match('/class=\"?zg-gray-normal\"?.+>(\d+)<.+span>/i', $str, $match_browse); $user_browse = $match_browse[1];
不足和待学习
整个过程中涉及php,shell,js,css,html,正则等语言和部署等基础知识,但还有诸多需要改进完善,小拽特此记录,后续补充例:
- php 采用multicul进行多线程。
- 正则匹配进一步优化
- 部署和抓取过程采用redis提升存储
- 移动端布局的兼容性提升
- js的模块化和sass书写css。
您可能感兴趣的文章:
- php IIS日志分析搜索引擎爬虫记录程序
- php 向访客和爬虫显示不同的内容
- 一个PHP实现的轻量级简单爬虫
- PHP实现简单爬虫的方法
- PHP代码实现爬虫记录——超管用
- PHP爬虫之百万级别知乎用户数据爬取与分析

人気の記事

人気の記事

ホットな記事タグ

メモ帳++7.3.1
使いやすく無料のコードエディター

SublimeText3 中国語版
中国語版、とても使いやすい

ゼンドスタジオ 13.0.1
強力な PHP 統合開発環境

ドリームウィーバー CS6
ビジュアル Web 開発ツール

SublimeText3 Mac版
神レベルのコード編集ソフト(SublimeText3)

ホットトピック











Ubuntu および Debian 用の PHP 8.4 インストールおよびアップグレード ガイド

PHP 開発用に Visual Studio Code (VS Code) をセットアップする方法
