火车头有一个正文提取器,而且不少的采集软件都有这个东西,但是就是一直不知道这些东西到底是怎么实现的?
或是有高人说下实现的原理是多少?
比如步骤?
或是如何用python来实现,可以举个简单的例子
欢迎选择我的课程,让我们一起见证您的进步~~
來源網址:http://www.cnblogs.com/jasondan/p/3497757.html
比較針對性的,可以使用p,article這些標籤來簡單判斷。如果需要普遍一點的,可以對採集的網頁資料進行分析,例如寫一個演算法計算中文(非標籤文字)的密集性來判斷是不是正文。具體沒做過,但想法基本上是這樣。
HTTP協定模擬,(通常用request,urllib2模組)
資訊擷取(由於HTML文檔特殊性,一般會用xpath,beautifulsoup)
來源網址:http://www.cnblogs.com/jasondan/p/3497757.html
比較針對性的,可以使用p,article這些標籤來簡單判斷。如果需要普遍一點的,可以對採集的網頁資料進行分析,例如寫一個演算法計算中文(非標籤文字)的密集性來判斷是不是正文。具體沒做過,但想法基本上是這樣。
HTTP協定模擬,(通常用request,urllib2模組)
資訊擷取(由於HTML文檔特殊性,一般會用xpath,beautifulsoup)