python - 请教这个页面中的这两个信息能否不用无头浏览器爬取到?

Question

在爬取"http://www.haodf.com/doctor/DE4r08xQdKSLBVM8i9sHYQ8uQGIO.htm"这个页面的时候, 发现"擅长"和"执业经历"这两个信息通过beautifulsoup是取不到的, 我选取这两个信息的代码如下: {代码...} 查询页面发现这...

PHP中文网 · Answer

可能这个页面，你要抓的这个数据，是页面加载后，使用js渲染出来的。也就是说，这个#full_DoctorSpecialize
里面的数据是ajax，从服务器上拿回来的。具体要如何拿这样的数据，你可以百度下 phantomjs ，你一定会有收获的。

PHP中文网 · Answer

这2个信息可以直接获取，只是信息包含在JS块中BigPipe.onPageletArrive({这个里面}) , 可以通过正则表达式获取。这个里面是一段JSON格式的字符串。匹配之后转换为json还是很容易处理的。想要通过查询接口获取的话，应该是可以的，不过得分析JS代码，这个太麻烦，可以通过抓包工具来抓它的http请求。然后看看是那个请求返回的数据。相比较而言还是写正则匹配比较快。

怪我咯 · Answer

这个就像楼上说的是js渲染的，内容在js代码里面，可以正则匹配js代码里面的元素，得到你想要的信息