网页爬虫 - python采集百度新闻的原理是什么?

Question

火车头有一个正文提取器,而且不少的采集软件都有这个东西,但是就是一直不知道这些东西到底是怎么实现的?

或是有高人说下实现的原理是多少?

比如步骤?

或是如何用python来实现,可以举个简单的例子

高洛峰 · Answer

來源網址：http://www.cnblogs.com/jasondan/p/3497757.html

PHP中文网 · Answer

比較針對性的，可以使用p，article這些標籤來簡單判斷。如果需要普遍一點的，可以對採集的網頁資料進行分析，例如寫一個演算法計算中文（非標籤文字）的密集性來判斷是不是正文。具體沒做過，但想法基本上是這樣。

PHP中文网 · Answer