通用网络爬虫的大致结构-云连代理
声明:本站只提供国内节点,仅用于合法的国内网络加速。
工作时间: 09:00-24:00 客服电话: 400-895-9980 客服QQ:800828360
您的位置:首页 >文章内容
通用网络爬虫的大致结构
来源: 作者:admin 时间:2019-01-15 10:05:33

通用网络爬虫的结构大致可以分为页面爬行模块 、页面分析模块、链接过滤模块、页面数据库、URL 队列、初始 URL 集合几个部分。为提高工作效率,通用网络爬虫会采取一定的爬行策略。 


云连HTTP代理是高质量的IP供应商,云连http拥有行业领先的代理IP控制机制,全自建服务器,欢迎免费下载领取IP试用。


常用的爬行策略有:深度优先策略、广度优先策略 。


深度优先策略:其基本方法是按照深度由低到高的顺序,依次访问下一级网页链接,直到不能再深入为止。 爬虫在完成一个爬行分支后返回到上一链接节点进一步搜索其它链接。 当所有链接遍历完后,爬行任务结束。 这种策略比较适合垂直搜索或站内搜索, 但爬行页面内容层次较深的站点时会造成资源的巨大浪费  。


广度优先策略:此策略按照网页内容目录层次深浅来爬行页面,处于较浅目录层次的页面首先被爬行。 当同一层次中的页面爬行完毕后,爬虫再深入下一层继续爬行。 这种策略能够有效控制页面的爬行深度,避免遇到一个无穷深层分支时无法结束爬行的问题,实现方便,无需存储大量中间节点,不足之处在于需较长时间才能爬行到目录层次较深的页面 。


云连http是超性价比的专业级HTTP代理IP服务商。