www.cnvd.org.cn是个很奇怪的网站,如过你用浏览器访问时正常的,但是如果用http请求就会出现各种错。比如:
wget http://www.cnvd.org.cn 返回:
--2016-08-26 20:37:00-- http://www.cnvd.org.cn/
Resolving www.cnvd.org.cn (www.cnvd.org.cn)... 113.200.91.208, 42.48.109.207
Connecting to www.cnvd.org.cn (www.cnvd.org.cn)|113.200.91.208|:80... connected.
HTTP request sent, awaiting response... 521
2016-08-26 20:37:00 ERROR 521: (no description).
如果用curl执行则会返回一段JS代码
js也研究了下。是动态设置cookie的。
一个月前整站已经被扒下来了,最近发现没有增加数据量才知道爬虫被ban了,前段时间调试的时候将浏览器的请求头全部复制到爬虫中科院正常运行,但是这两天此方法已经失效。。。
请大家给我个思路,感觉瞬间没爱了!
Votre robot doit avoir été détecté par le site Web. Si les en-têtes ne fonctionnent pas, vous pouvez uniquement vérifier s'il est restreint par votre adresse IP ou votre compte. Si vous n'avez pas besoin de vous connecter, vous pouvez d'abord essayer de changer l'adresse IP. pour voir si c'est normal, ou directement Accédez manuellement au serveur du robot pour voir si cela réussit
------Mise à jour-------
À la demande de la personne qui a posé la question, j'ai posté le code de test. Le cookie ici vient d'être obtenu par accès manuel. Il ne posera aucun problème pour y accéder. Quant au délai d'expiration du cookie, je ne l'ai pas fait. regardez attentivement. Si la personne qui pose la question Si vous ne comprenez pas, je n'aurai plus l'air bien.
J'espère que cela vous aidera
Ami, j'ai parcouru ce site récemment et j'aimerais vous donner quelques avis. Vous pouvez y jeter un œil. Si vous souhaitez communiquer, veuillez m'ajouter comme ami.
le cnvd peut être escaladé dans des circonstances normales.
www.cnvd.org.cn est assez dégoûtant, avec de nombreuses têtes tournées vers le 521.