Google PageRank 原本解决的是:在网页数量爆炸、内容质量参差不齐的情况下,如何不依赖人工编辑,自动判断一个网页是否值得排在搜索结果前面。它的核心思路不是看页面自己说自己多好,而是看其他网页是否愿意链接它,以及那些链接它的网页本身是否重要。这个判断方式把“投票”和“投票者权重”结合起来,成为早期 Google 排序的重要基础。
在 PageRank 出现之前,很多搜索引擎主要依赖页面上的文字匹配:你搜什么词,它就找包含这个词的页面。问题是,页面作者可以反复堆砌关键词,让页面看起来相关,但内容未必可靠。PageRank 换了一个角度:如果很多页面都链接到某个页面,说明这个页面被当作参考来源;如果链接它的页面本身也被很多页面链接,那么这一票更有分量。
用一个假设例子说明。假设有三个页面 A、B、C 都链接到页面 X。A 是一个无人链接的小页面,B 和 C 则被大量其他页面链接。按照 PageRank 的思路,B 和 C 给 X 的“投票”权重大于 A。这样,X 即使没有在标题里反复写目标词,也可能因为被重要页面引用而获得较高的基础评价。
因此,PageRank 原本解决的是排序中的信任问题:把链接当作推荐,把推荐者的质量纳入计算,而不是只看页面自己写了什么。
很多人把 PageRank 理解成“外链越多越好”,这偏离了它原本要解决的问题。PageRank 关注的是链接结构中的相对重要性,而不是简单计数。一个来自高权重页面的链接,和几十个来自低质量页面的链接,在原始设计中的意义并不相同。
判断一个链接是否可能对页面评价有帮助,可以看这几个检查项:
这些检查项不能直接读出 Google 当前的内部分值,但可以用来判断链接质量的方向。PageRank 原本要奖励的是“被可信来源推荐”,不是“链接数量堆积”。
如果已经有一个页面或项目,想沿着 PageRank 的思路改进,最关键的一步不是去找外链,而是先让页面具备被引用的理由。PageRank 的原始问题是判断哪个页面更值得信任,那么你的页面需要先成为别人愿意引用的对象。
可以按下面顺序实施:
这里的判断结果是:如果页面开始被主题相关的页面自然引用,说明它更接近 PageRank 原本奖励的对象;如果只有你自己在站内反复链接,或者只有低质量目录链接,那并没有解决“谁更可信”的问题。
PageRank 是 Google 历史上的重要概念,公开的 PR 值早已不是可靠的当前判断依据。第三方工具显示的所谓 PR 仿值、域名评分或链接权重,都不能等同于 Google 官方数据。验证时,应该回到可观察的事实:
维护阶段要做的是持续更新页面内容,让它保持可引用状态。PageRank 原本解决的是静态链接结构中的信任排序,而今天的搜索环境更复杂,所以不能把旧概念当成唯一排名因素。它的价值在于提醒你:页面要被别人当作参考,而不是只对自己说好。
下一步,选一个你已有的核心页面,列出它目前被哪些页面引用、引用语境是什么,然后补一段别人可以直接引用的定义或步骤。这个动作比追逐任何分数都更接近 PageRank 原本要解决的问题。