谷歌PR新概念!以链接距离为基础

阅读 62来源:

一、谷歌PR(PageRank)

Google PR是Google诞生以来最具知名度的概念,一位自称的前 Google软件工程师在Hacker News的一个讨论Google替代品的帖子中透露,Google早在2006年就不再使用Google PR了!

谷歌PR新概念!以链接距离为基础

2016年4月,Google取消了工具条输出PR值的显示,站长们再也看不到最新的PR值了,也有很多SEO认为Google完全取消了PageRank算法。现在的Google排名算法中还有PageRank吗?众说纷纭。

谷歌PR新概念!以链接距离为基础

翻译过来的意思是:

 

评论里说PageRank是Google秘方的说法并不正确 — 从2006年Google就不再用 PageRank了。关于搜索和点击率数据很重要的说法还比较靠谱……

 

说得很明确,Google算法早就不再使用PageRank了。

 

 

JohnMu去年也直接评论过PageRank的使用情况,表示现在的Google算法不可能还是一比一地原样用PageRank的最初公式。

那么2006年以后工具条显示的PR是什么鬼?

 

前面提到,Google是从2016年取消工具条显示PR的,如果2006年就不再用PR了,那么2006年后工具条上显示的PageRank是什么东西?

 

而且Google的另一位发言人Gary Illyes在2017年还发推明确说:“你们不知道吗,Google在18年后依然在排名算法中使用PageRank”

 

Jonathan Tang后续又解释了一下:

 

他们2006年用另一个算法取代了PR,那个算法给出的结果大致和PR相似,但计算速度快得多。工具条显示的宣称是PR的数值就是这个替代算法的结果。这个替代算法的名字都和PageRank相似,所以Google这么宣称,在技术上也不能说是错的。

 

所以,从2006年开始,Google算法中使用的、工具条所显示的,都不是原始PageRank计算公式的结果,而是一个结果类似、名称类似、计算速度快得多的算法。

 

二、Google PageRank新算法。

那么这个Google新PR的计算原理是什么?Jonathan Tang没说,连真实名称也没说,大家只能猜测了。

疑似Google新PageRank专利

 

Jonathan Tang的帖子后面,专门研究Google专利的大神Bill Slawski发了个回复:

 

Google的新版本PageRank专利2006年通过。巧合?

 

Bill Slawski去年发帖详细介绍过这个新版本PageRank专利,这两天又仔细读了一下专利原文和Bill Slawski的帖子,这里介绍一下大意。

 

专利名称是Producing a ranking for pages using distances in a web-link graph – 基于链接距离的页面级别计算。

 

简单说,新PageRank不再计算导入链接的总数,而是计算这个页面与种子页面之间的距离,距离越近,页面质量越高,页面级别、新PageRank越高。这个思路和Yahoo!的TrustRank是极为相近的,基本假设都是:好网站不会链接向坏网站,但会链接向其它好网站。

种子页面、链接长度、链接距离

 

这个专利涉及几个概念。种子页面(Seed Pages)、链接长度(Link Length)、链接距离(Link Distance)。

 

三、种子页面(Seed Pages)

谷歌PR新概念!以链接距离为基础

如上面的简单网络链接图所示,Google选出一部分页面作为种子页面,如图中上半部分的页面106、108、110,下半部分的都是种子页面集之外的、需要计算新PR值的。

 

关于种子页面的几个要点:

 

1、种子页面显然是高质量的页面,专利里举的例子是Google目录(其实就是已经死了的开放目录)和纽约时报。

2、种子页面需要与其它非种子页面有很好的连通性,有比较多的导出链接指向其它高质量页面。

3、种子页面需要稳定可靠,有多样性,大范围覆盖各类主题。

 

四、链接长度(Link Length)

 

种子和非种子之间有的离得近,有的离得远。如种子页面106通过链接132直接连向非种子页面112,非种子页面118则没有种子页面直接连向它,要通过两层链接。

 

链接距离并不是简单地数链接层数。每个链接Google会计算一个链接长度,链接长度取决于链接本身的特征和链接所在页面的特征,比如页面上有多少链接,链接的位置,链接文字所用字体等等。

 

所以,同样是一个链接,链接长度是不一样的:

 

1、页面导出链接越多,链接长度越长。这和原始PageRank思路是一样的,导出链接越多,每个链接分到的权重越少。

2、链接所在位置越重要,比如正文中,正文靠前部分,链接长度越短。

3、链接锚文字字号越大,或者在H1中,可能链接长度越短。

 

我记得Matt Cutts很久以前在谈到PageRank可能的修正时提到过,正文中的链接和页脚的链接被用户点击到的概率显然差距很大,所以不同位置的链接获得的PR和权重应该是不一样的。这种说法很符合这个专利的意思。

 

五、链接距离(Link Distance)

链接距离就是页面与种子页面集合之间的最短链接长度之和。种子页面和非种子页面之间通常不止一条链接通路,如示意图中,页面118可以通过链接132、136从种子页面106到达,也可以通过链接134、142、140到达,还可以通过链接134、140到达,还可以通过其它链接从其它种子页面到达,所有这些从种子集到页面的链接通路中,链接长度之和最短的那个被定义为链接距离。

 

如果一个页面无法从任何种子页面出发访问到,也就是种子页面集合到这个页面完全没有链接通路,那么链接距离是无限大。

 

然后Google算法根据链接距离计算出一个页面的排名能力分数,也就是新PR值,最后的排名算法中,这个新PR值作为排名因素之一。也就是说,链接距离越短,离种子越近,Google认为页面越重要,排名能力越高。

 

链接距离的计算不需要迭代,所以比原版PageRank的计算要快得多,而在代表页面重要性上,我相信Google做过对比,准确性差不多,所以就用来代替原来的PR了。

 

六、简化链接网络图(Reduced Link-Graph)

如果一个页面从种子集合完全没有链接通路可以到达,也就是前面说的链接距离为无限大,这个页面将被排除在简化链接网络图之外。如果一个页面得到的链接都来自简化链接网络之外,虽然链接总数可能很大,但其链接距离依然是无限大。

 

换句话说,在简化链接网络之外的链接是被忽略掉的,无论有多少链接。联想到Penguin 4.0算法更新,其中一个特征就是,垃圾链接是被忽略掉的,不被计入链接的流动中,这和基于链接距离的页面级别非常相似。

» » « «

网站SEO优化相关文章