来源:互联网
作者:zlDL@bian10
发布时间:2021.04.07
什么是网络爬虫?我们能够通过爬虫来获取网站的内容,抓取到我们设定好需要的数据。下面我们来认识爬虫的分类,以及一些爬虫时遇到的问题常见解决方式。
爬虫的分类:
传统爬虫:从一个或若干初始网页的URL开始,获得初始网页上的URL,在抓取网页的过程中,不断从当前页面上抽取新的URL放入队列,直到满足系统的一定停止条件。
聚焦爬虫:工作流程较为复杂,需要根据一定的网页分析算法过滤与主题无关的链接,保留有用的链接并将其放入等待抓取的URL队列。然后,它将根据一定的搜索策略从队列中选择下一步要抓取的网页URL,并重复上述过程,直到达到系统的某一条件时停止。
另外,所有被爬虫抓取的网页将会被系统存贮,进行一定的分析、过滤,并建立索引,以便之后的查询和检索;对于聚焦爬虫来说,这一过程所得到的分析结果还可能对以后的抓取过程给出反馈和指导。
爬虫被封常见解决方式:
1、技术处理【调节网页爬虫的请求频率】
在程序中使用伪装术,不明目张胆的爬【使用代理;使用高级爬虫(不定周期爬)】
2、简单处理【随时更换动态ip】
如果在公司被封ip,则可考虑重启路由,重新获取公网ip
自动更改IP地址反爬虫封锁,支持多线程,可参考(待校验)
3、网络处理【与第2点类似,代理IP访问】
被封ip后,本地ip不能访问该网站,但是设置了代理服务器后,浏览器可以访问该网站【注意:程序不可以访问网站,故可以给请求的http设置代理】。
可以在命令行加路由,一般格式为:routeaddip地址mask子网掩码默认网关前提:把掩码要改成跟上面掩码一样。这个路由重新开机就没有了。可以routeadd-pip地址mask子网掩码默认网关。这样的话,重新开机都在的。