网页爬虫 - python采集百度新闻的原理是什么?
天蓬老师
天蓬老师 2017-04-18 09:03:01
0
3
936

火车头有一个正文提取器,而且不少的采集软件都有这个东西,但是就是一直不知道这些东西到底是怎么实现的?

或是有高人说下实现的原理是多少?

比如步骤?

或是如何用python来实现,可以举个简单的例子

天蓬老师
天蓬老师

欢迎选择我的课程,让我们一起见证您的进步~~

全部回复(3)
小葫芦


来源地址:http://www.cnblogs.com/jasondan/p/3497757.html

洪涛

比较针对性的,可以使用p,article这些标签来简单判断。如果需要普遍一点的,可以对采集的网页数据进行分析,比如写一个算法计算中文(非标签文字)的密集性来判断是不是正文。具体没做过,但是思路基本是这样。

Ty80
  1. HTTP协议模拟,(通常用request,urllib2模块)

  2. 信息提取(由于HTML文档特殊性,一般会用xpath,beautifulsoup)

热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责声明 Sitemap
PHP中文网:公益在线PHP培训,帮助PHP学习者快速成长!