在抓取网页的时候,网络蜘蛛一般有两种策略:广度优先和深度优先
广度优先是指网络蜘蛛会先抓取起始网页中链接的所有网页,然后再选择其中的一个链接网页,继续抓取在此网页中链接的所有网页。这是最常用的方式,因为这个方法可以让网络蜘蛛并行处理,提高其抓取速度。
深度优先是指网络蜘蛛会从起始页开始,一个链接一个链接跟踪下去,处理完这条线路之后再转入下一个起始页,继续跟踪链接。这个方法有个优点是网络蜘蛛在设计的时候比较容易。
百度蜘蛛是顺着链接爬,每个链接里会收录一些关键词建立数据库。img的文件只能从其属性alt中记录,没有alt是没有办法收录的,js至今还没有能力和技术去爬行,凡是不能识别的百度都会认为是不友好的。
百度蜘蛛是根据你网站综合情况来抓取的,网站文章日常更新比较及时,可能抓取的比较快。不然自动抓取时间会很慢,网站地图做好后,你可以在百度站长工具——链接提交——sitemap里提交下,这样抓取更快一点呢。欢迎分享,转载请注明来源:内存溢出
评论列表(0条)