python - 如何爬取跳转网站的数据
怪我咯
怪我咯 2017-05-19 10:07:30
0
2
1048

目前在学习一些爬虫的知识,对于一些复杂的网站使用selenium进行爬取。
碰到一个问题,我需要爬取的工单网站(不知道密码)需要先通过登录一个鉴权系统,然后鉴权系统页面点击其中的工单系统连接,就会自动免登录跳转到工单系统网站,这种系统的数据我该如何使用爬虫进行抓取?
以下是鉴权系统selenium拿到关于工单系统的html

<a href="/link-test001" target="_blank" title="工单系统" rel="link-test001" data="1" datasrc="工单系统|||/files/link/test001.gif|||new|||/link-test001">
    <img src="/files/link/test001.gif" width="25" height="25" alt="工单系统" align="absmiddle"><span>工单系统</span>
</a>
怪我咯
怪我咯

走同样的路,发现不同的人生

全部回复(2)
漂亮男人

用firefox的扩展selenium ide录制一遍操作。
然后导出为python文件。
改改运行就可以了。

建议你去读读虫师写的书。

曾经蜡笔没有小新

例如使用requests库作为爬虫的话,先创建session(),A登录,B是跳转的页面即可。

T=requests.session()
A=T.post(url=url,data=data)
B=T.get(url=url)

创建的T就代表存储的cookie,会一直保留

热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板