社区

学习

工具库

AI工具

休闲

简体中文

首页 > Java > java教程 > 使用Jsoup实现爬虫技术的方法介绍

使用Jsoup实现爬虫技术的方法介绍

不言

发布： 2019-03-08 15:37:54

转载

3499 人浏览过

本篇文章给大家带来的内容是关于使用Jsoup实现爬虫技术的方法介绍，有一定的参考价值，有需要的朋友可以参考一下，希望对你有所帮助。

1.Jsoup简述

Java中支持的爬虫框架有很多，比如WebMagic、Spider、Jsoup等。今天我们使用Jsoup来实现一个简单的爬虫程序。

Jsoup拥有十分方便的api来处理html文档，比如参考了DOM对象的文档遍历方法，参考了CSS选择器的用法等等，因此我们可以使用Jsoup快速地掌握爬取页面数据的技巧。

2.快速开始

1)编写HTML页面

页面中表格的商品信息是我们要爬取的数据。其中属性pname类的商品名称，以及属于pimg类的商品图片。

2)使用HttpClient读取HTML页面

HttpClient是一个处理Http协议数据的工具，使用它可以将HTML页面作为输入流读进java程序中。可以从http://hc.apache.org/下载HttpClient的jar包。

3)使用Jsoup解析html字符串

通过引入Jsoup工具，直接调用parse方法来解析一个描述html页面内容的字符串来获得一个Document对象。该Document对象以操作DOM树的方式来获得html页面上指定的内容。相关API可以参考Jsoup官方文档：https://jsoup.org/cookbook/

下面我们使用Jsoup来获取上述html中指定的商品名称和价格的信息。

至此，我们已经实现使用HttpClient+Jsoup爬取HTML页面数据的功能。接下来，我们让效果更直观一些，比如将爬取的数据存到数据库中，将图片存到服务器上。

3.保存爬取的页面数据

1)保存普通数据到数据库中

将爬取的数据封装进实体Bean中，并存到数据库内。

2)保存图片到服务器上

直接通过下载图片的方式将图片保存到服务器本地。

4.总结

本案简单实现了使用HttpClient+Jsoup爬取网络数据，对于爬虫技术本身，还有很多值得深挖的地方，以后再为大家讲解。

以上是使用Jsoup实现爬虫技术的方法介绍的详细内容。更多信息请关注PHP中文网其他相关文章！

相关标签：

jsoup

上一篇：java8常用内置函数的总结（代码示例）下一篇：springboot项目创建教程（IntelliJIDEA，springboot 2.0 +mybatis）

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

作者最新文章

编程是什么？

2019-04-16 16:04:28
查找的快捷键是ctrl键加上什么键

2020-09-15 11:26:00
剪切快捷键ctrl加什么？

2020-09-10 14:26:14
it是什么职业？

2020-09-08 11:06:15
ctrl加什么是保存？

2020-09-09 09:46:36
ctrl+t是什么快捷键？

2020-10-12 14:51:04
PS标尺怎么用？

2020-09-10 14:40:02
编程适合什么人学？

2019-04-24 16:20:55
ps反向选区快捷键是什么？

2020-10-13 11:40:03
如何在两个内联元素之间添加换行符

2019-04-15 14:06:21

最新问题

objective-c - presentViewController后,dismiss回来高度偏差

来自于 1970-01-01 08:00:00

0

0

0

把gitlab中的测试项目，添加到jenkins发生认证错误

来自于 1970-01-01 08:00:00

0

0

0

objective-c - 做post请求时，服务端可以检测到接收到两个非空的字段，但是返回了错误

来自于 1970-01-01 08:00:00

0

0

0

github中如何将本地分支与远程标签合并？

来自于 1970-01-01 08:00:00

0

0

0

objective-c - textfield输入字符串过滤

来自于 1970-01-01 08:00:00

0

0

0

相关专题

更多>

热门推荐

热门教程

更多>

相关教程

热门推荐

最新课程

最新ThinkPHP 5.1全球首发视频教程(60天成就PHP大牛线上培训班课)

1437622
php入门教程之一周学会PHP

4297751
JAVA 初级入门视频教程

2668286
小甲鱼零基础入门学习Python视频教程

516865
PHP 零基础入门教程

877781

最新下载

更多>

网站特效

网站源码

网站素材

前端模板