您的位置: 首页 > 新闻资讯 > 正文

爬虫要怎么开始?

发布时间:2019-10-25 16:22:35 来源:

怎么开展一个爬虫?对于每一个刚刚接触这一领域的新人,这似乎是大家都会思考的问题。在建立好爬虫使用的代理IP池之后,重点就在于开展了,爬虫的过程中需要考虑什么,有哪些因素会受到影响?下面我们来看看。


爬虫要怎么开始?


抓取算法采用优先队列调度,区别于单纯的BFS,对于每个网页设定一定的抓取权重,优先抓取权重较高的网页。对于权重的设定,考虑的因素有:


1、是否属于一个比较热门的网站


对于热门的网站,不能无限制的抓取,所以需要进行二级调度。首先调度抓取哪个网站,然后选中了要抓取的网站之后,调度在该网站中抓取哪些网页。这样做的好处是,非常礼貌的对单个网站的抓取有一定的限制,也给其他网站的网页抓取一些机会。


2、链接长度


3、link到该网页的网页的权重


4、该网页被指向的次数等等


爬虫有哪些需要注意的地方?


网络模型分别考虑单机抓取和分布式抓取的情况。对于Windows的单机,可以使用IOCP完成端口进行异步抓取,该种网络访问的方式可以最大程度的利用闲散资源。因为网络访问是需要等待的,如果简单的同时开多个线程,计算机用于线程间切换的耗费会非常大,这种用于处理抓取结果的时间就会非常少。IOCP可以做到使用几个线程就完成几十个线程同步抓取的效果。对于多机的抓取,需要考虑机器的分布,如抓取亚洲的站点,则用在亚洲范围内的计算机等等。


实时性新闻网页的抓取一般来说是利用单独的爬虫来完成。新闻网页抓取的爬虫的权重设置与普通爬虫会有所区别。首先需要进行新闻源的筛选,这里有两种方式,一种是人工设置新闻源,如新浪首页,第二种方式是通过机器学习的方法。新闻源可以定义链接数非常多,链接内容经常变化的网页。从新闻源网页出发往下抓取给定层级限制的网页所得到,再根据网页中的时间戳信息判断,就可以加入新闻网页。


网页更新网页如果被抓下来以后,有的网页会持续变化,有的不会。这里就需要对网页的抓取设置一些生命力信息。当一个新的网页链接被发现以后,他的生命力时间戳信息应该是被发现的时间,表示马上需要被抓取,当一个网页被抓取之后,他的生命力时间戳信息可以被设置为x分钟以后,那么,等到x分钟以后,这个网页就可以根据这个时间戳来判断出,他需要被马上再抓取一次了。一个网页被第二次抓取以后,需要和之前的内容进行对比,如果内容一致,则延长下一次抓取的时间,如设为2x分钟后再抓取,直到达到一个限制长度如半年或者三个月(这个数值取决于你爬虫的能力)。如果被更新了,则需要缩短时间,如,x/2分钟之后再抓取。


想要学好爬虫,需要经过不断的练习、测试、调整,这样才能够充分掌握爬虫技术。


相关文章内容简介

1 爬虫要怎么开始?

  怎么开展一个爬虫?对于每一个刚刚接触这一领域的新人,这似乎是大家都会思考的问题。在建立好爬虫使用的代理IP池之后,重点就在于开展了,爬虫的过程中需要考虑什么,有哪些因素会受到影响?下面我们来看看。  抓取算法采用优先队列调度,区别于单纯的BFS,对于每个网页设定一定的抓取权重,优先抓取权重较高的网页。对于权重的设定,考虑... [阅读全文]