当前位置:首页 > 运营推广

搜索引擎收录网页的四个阶段

时间:2018-12-19 10:40:00来源:运营推广 作者:seo实验室小编 阅读:83次
 

好梦网

作为SEO从业者,不仅要被搜索引擎抓取,还要被收录,最重要的是在收录后有良好的排名,本文将简单分析下搜索引擎收录网页的四个阶段。每个网站、每个网页的排名都是不一样的,看看你的网站处于哪个阶段呢?

搜索引擎收录网页的四个阶段 PageRank 搜索引擎 建站教程 第1张

网页收录第一阶段:大小通吃

搜索引擎的网页抓取都是采取「大小通吃」的策略,也就是把网页中能发现的链接逐一加入到待抓取URL中,机械性的将新抓取的网页中的URL提取出来,这种方式虽然比较古老,但效果很好,这就是为什么很多站长反应蜘蛛来访问了,但没有收录的原因,这仅仅是第一阶段。

网页收录第二阶段:网页评级

而第二阶段则是对网页的重要性进行评级,PageRank是一种著名的链接分析算法,可以用来衡量网页的重要性,很自然的,站长可以用PageRank的思路来对URL进行排序,这就是各位热衷的「发外链」,据一位朋友了解,在中国「发外链」这个市场每年有上亿元的规模。

爬虫的目的就是去下载网页,但PageRank是个全局性算法,也就是当所有网页有下载完成后,其计算结果才是可靠的。对于中小网站来讲,服务器如果质量不好,如果在抓取过程中,只看到部分内容,在抓取阶段是无法获得可靠的PageRank得分。

网页收录第三阶段:OCIP策略

OCIP策略更像是PageRank算法的改进。在算法开始之前,每个网页都给予相同的「现金」,每当下载某个页面A后,A将自己的「现金」平均分给页面中包含的链接页面,把自己的「现金」清空。这就是为什么导出的链接越少,权重会越高的原因之一。

而对于待抓取的网页,会根据手头拥有的现金多少排序,优先下载现金最充裕的网页,OCIP大致与PageRank思路一致,区别在于:PageRank每次要迭代计算,而OCIP则不需要,所以计算速度远远快于PageRank,适合实时计算使用。这可能就是为什么很多网页会出现「秒收」的情况了。

网页收录第四阶段:大站优先策略

大站优先的思路很直接,以网站为单位来衡量网页的重要性,对于待抓取的URL队列中的网页,根据所述网站归类,如果哪个网站等待下载的页面最多,则优先下载这些链接。其本质思想是「倾向于优先下载大型网站URL」。因为大型网站往往包含更多的页面。鉴于大型网站往往是名站,其网页质量一般较高,所以这个思路虽然简单,但有一定依据。

实验表明这个算法虽然简单粗暴,但却能收录高质量网页,很有效果。这也是为什么许多网站的内容被转载后,大站却能排到你前面的最重要原因之一。

相关阅读

搜索引擎链接分析中的链接优化

感谢Lenny投稿在网站优化中,常常提到的“内容为王,链接为皇”现在已经不止是这么两点了,另外还有用户体验综合因素在内,内

网站改版后的尴尬:度娘为何还在收录你的网站死链?

在经手公司的网站优化运营前,我们有好长一段时间还是对老网站进行简单的维护和象征性的优化修改,可是好长时间过去后网站的效果还是

归纳总结那些促进收录排名的百度系产品

虽然百度现在在移动端流量并不是很给力,但是其依然是国内最大的搜索引擎,占有率达70%以上,所以做网站很大程度上是要看百度脸色的。

浅析新版百度搜索引擎工作原理

近日,新版百度搜索引擎正式上线了,貌似除了少敲一个回车键和导航改到搜索框下方,其他没什么改变,其实未必是这样的,在新版的搜索引擎出

解读百度首份《搜索引擎优化指南》

我们知道Google之前有发布一份“Google搜索引擎优化指南”,而近期百度也在百度创业者俱乐部发布了官方首份“百度

分享到:
发表评论
用户名: 密码: 匿名

栏目导航

推荐阅读

热门阅读