爬虫怎么解决封IP的问题？_服务器

总的来讲，网站的反爬虫的策略有：检测爬取频率、并发连接数目、>

其中最常见的就是判断你的请求频率和并发数量，如果你在短时间内发送了大量的请求，也就是你的爬取速度很快的话，那么他就直接判断你是爬虫，这时候先把你IP封了再说，免得给自己的网站带来负担。

那么这些策略我们都如何应对呢？这几个方法都不同，

1、爬虫伪装浏览器点击

我们先理解一下网站的代码执行，首先我们向服务器发送请求，这时服务器的后台php、java都会执行，然后网站代码被发送到本地，在本地时js、ajax会在浏览器内核中执行。所以这时候我们就知道，爬虫不仅要欺骗phpjava代码、还要欺骗js和ajax代码。

2、使用代理

爬的太快会被封，是一定的。爬的太慢又非常耗时间。所以很多人都会说可以使用代理，所谓代理就是介于用户与网站之间的第三者：用户先将请求发到代理，然后代理再发到服务器，这样看起来就像是代理在访问那个网站了，实现一个不断的切换IP的假象。网上免费代理很多，但是能用的没几个，如果不想购买付费的代理，大家可以学习一下

3、降低访问频率

如果一直找不到好用的免费代理，又不想付费，最好的办法就是降低访问频率了。这样做可以达到与用代理一样的效果——防止被对方从访问量上看出来。比如：每抓取一个页面就休息随机几秒、限制每天抓取的页面数量。当然，在抓取效率上会差很多，因为数据量大的话，时间就会很长。

欢迎分享，转载请注明来源：内存溢出

原文地址: http://outofmemory.cn/zz/10845014.html

爬虫怎么解决封IP的问题？

发表评论

评论列表（0条）