現在的微信的用戶是越來越多了當然會關注很多微信公眾號了,微信公眾號中的文章也可見是很長看的,今天就跟大家分析如何用PHP寫出採集微信公眾號文章的方法以及程式碼詳細講解,讓我們一起來看看吧!
透過搜狗搜尋擷取公眾號歷史訊息有幾個問題:
1、有驗證碼;
2、歷史訊息清單只有最近10條群發內容;
3、文章地址是有有效期的;
4、據說批量採集還要換ip;
透過我前面文章的方法就沒有這些問題,雖然採集系統搭建不如傳統採集器寫個規則去爬就可以了那麼簡單。但是一次搭建好之後批量採集的效率還是可以的。而且採集的文章地址是永久有效的,並且可以收集到一個公眾號所有的歷史消息。
我們還是從一個公眾號文章的連結地址開始看:
1、從微信右上角選單複製到的連結地址:
##http:/ /mp.weixin.qq.com/s/fF34bERZ0je_8RWEJjoZ5A2、歷史訊息清單中取得的位址:
http://mp. weixin.qq.com/s?biz=MjM5NDAwMTA2MA==&mid=2695729619&idx=1&sn=8be0b6bd0210cee0d492ebdf20f7371f&chksm=83d74818b4a0630286b 781166066a69afef3705eabdb3b85&scene=4#wechat_redirecthttps://
mp.weixin.qq.com/s?biz=MjM5NDAwMTA2MA==&mid=2695729619&idx=1&sn=8be0b6bd0210cee0d492ebdf20f7371f&chksm=83d74818b4a0c10ef286b33bb7deb73226125f866ddb5b2781166066a69afef3705eabdb3b85&scene=37&key=c81d77271180a0e6ce32be2d9dcaa2a7436aeba2c1d47a20d02194d1c944a8286a8eded93495eeadd05da412bbfaa638a379750aeaa4cf5c00e4d7851c5710d9b9736b80e3c72770a57a515c23ff2400&ascene=3&uin=MzUyOTIyNQ%3D%3D&devicetype =iOS10.1.1&version=16050120&nettype=WIFI&fontScale=100&pass_ticket=FGRyGfXLPEa4AeOsIZu7KFJo6CiXOZex83Y5YBRglW4%3D&wx_header=1#33D&wx_header=1#33D&wx_header=1#33D&wx_header=1#33D&wx_header=1#33D&wx_header=13D&wx_header=1#33D&wx_header=13D&wx_header=13D&wx_header=13D&wx_header=13D&wx_header=13D&wx_header=13D&wx_header,是個結果。 和歷史訊息頁一樣,微信有一套自動補充參數的機制。第一個位址是複製連結得到的,看起來是一個偽裝的編碼。其實沒什麼用我們不做考慮了。第二個地址是透過前面文章介紹的方法,從歷史消息的json文章列表中獲得到的連結地址,我們就是可以將這個地址保存到資料庫中。之後就可以透過這個位址從伺服器取得到文章內容。而第三個連結補充了參數之後,目的是為了讓文章頁中的閱讀量js可以取得到閱讀量點讚量的json結果而加上的參數。我們前面文章的方法中因為文章頁面被客戶端打開顯示了出來,因為有了這些參數,文章頁面中的js就去自動獲取閱讀量了,所以我們才能透過代理服務取得到這篇文章的閱讀量。
(我的資料庫中已儲存的文章列表,一部分欄位)
1、取得文章原始碼:
#透過php的函數file_get_content()就可以將文章原始碼讀取到變數中。微信文章的源代碼因為可以從瀏覽器打開所以我就不在這裡粘貼了,以免浪費頁面空間。<? //$content_url 变量的值为文章地址 $html = file_get_contents($content_url); ?>
原文內容是包含在一個標籤中的,透過php程式碼
取得:
正規的開頭識別
,結尾辨識