Google 搜索工作原理与排名系统研究笔记
来源(官方,已验证可访问):
一、搜索的三个阶段
官方将 Google 搜索的工作流程分为三个阶段,并强调:三个阶段并非每个网页都会经历全部;Google 不保证抓取、索引或展示任何网页,即使它符合搜索要素。
flowchart LR
A[网址发现] --> B[抓取 Crawling]
B --> C[编入索引 Indexing]
C --> D[呈现 Serving]
B -.障碍.-> X1[robots.txt / 服务器错误 / 需登录]
C -.障碍.-> X2[noindex / 质量过低 / JS 问题]
D -.障碍.-> X3[与查询无关 / 质量低 / 呈现规则阻止]
阶段 1:抓取(Crawling)
- 执行抓取的程序是 Googlebot(也称 crawler、robot、spider),从互联网发现网页并下载文本、图片和视频。
- 不存在中央网页注册表,Google 需要持续做网址发现(URL discovery),途径:已知网页上的链接(如类别页链到新博文)、站长提交的站点地图(sitemap)。
- Googlebot 用算法决定抓取哪些网站、抓取频率(crawl rate)、每站抓取的网页数,并根据网站响应调整(如遇到 HTTP 500 错误则降低抓取速度)。
- 抓取时 Google 使用最新版 Chrome **渲染(render)**网页并运行其中的 JavaScript——因为许多网站依赖 JavaScript 呈现内容。
- 常见抓取障碍:服务器问题、网络问题、robots.txt 规则阻止、需要登录才能访问的页面。
阶段 2:编入索引(Indexing)
- 处理和分析文字内容及关键内容标记和属性:
<title>元素、alt 属性、图片、视频等。 - Google 判断网页是否为重复内容:将内容相似的网页聚类(clustering),选出最具代表性的规范网页(canonical),其余作为备用版本在不同情境下呈现。
- 同时收集关于规范网页的信号(signals):页面语言、内容针对的国家/地区、网页易用性等。
- 信息存储在 Google 索引(Google index)——托管在数千台计算机上的大型数据库。
- 不被索引的常见原因:内容质量低、robots
meta规则禁止索引、网站设计问题(尤其 JavaScript)。
阶段 3:呈现搜索结果(Serving search results)
- 排名完全程序化(programmatically),Google 不收费提升排名。
- 相关性(relevancy)由数百个因素决定,包括用户的位置、语言、设备。官方例子:搜索「自行车维修店」,巴黎与香港用户结果不同。
- 搜索功能(search features)随查询变化:搜「自行车维修店」显示本地结果而非图片;搜「现代自行车」则显示图片。
- 已被索引但不显示的可能原因:内容与查询无关、内容质量低、robots
meta规则阻止呈现。
二、官方承认的排名系统(Ranking Systems)
来自官方《排名系统指南》。这份文档的价值在于:它是 Google 唯一一份逐个列出在用排名系统的清单,可以直接反驳大量第三方 SEO 传言。
当前使用的系统(17 个)
| 英文原名 | 中文 | 一句话说明 |
|---|---|---|
| BERT (Bidirectional Encoder Representations from Transformers) | — | 基于 Transformer 的双向编码模型,理解字词不同组合表达的不同含义与意图 |
| Crisis information systems | 危机信息系统 | 危机时刻提供及时实用信息,含个人危机(personal crisis)与 SOS 警报(SOS Alerts)子系统 |
| Deduplication systems | 重复信息删除系统 | 避免展示过度相似的网页 |
| Exact match domain system | 完全匹配网域系统 | 避免过度看重域名与查询词完全匹配的网站 |
| Freshness systems | 时效性系统 | 对时效性查询按用户预期显示较新内容 |
| Link analysis systems and PageRank | 链接分析系统和 PageRank | 通过网页间链接判断网页内容和实用程度 |
| Local news systems | 本地新闻系统 | 识别并及时展示相关本地新闻来源 |
| MUM (Multitask Unified Model) | 多任务统一模型 | 能理解和生成语言的 AI 系统,仅用于特定用途(如改进疫苗信息搜索),不用于一般排名 |
| Neural matching | 神经匹配 | 理解查询和网页中概念的表示并相互匹配 |
| Original content systems | 原创内容系统 | 让原创内容(含原创报道)优先于仅引用它的内容 |
| Removal-based demotion systems | 基于移除的降位系统 | 根据大量有效内容移除要求对网站降位 |
| Passage ranking system | 段落排名系统 | 识别网页中的段落(passages),更精细地判断相关性 |
| RankBrain | — | 理解字词与概念的关系,内容不含查询确切字词也能匹配 |
| Reliable information systems | 可靠信息系统 | 多系统协同展示最可靠信息,对低可靠性情形给出内容警示 |
| Reviews system | 评价系统 | 奖励包含深刻分析和原创研究的优质评价内容 |
| Site diversity system | 网站多元化系统 | 一般不在靠前结果中显示同一网站超过两个网页 |
| Spam detection systems | 垃圾内容检测系统 | 多个系统(包括 SpamBrain)处理违反垃圾内容政策的内容和行为 |
已退役的系统(4 个,功能已并入核心排名系统)
| 英文原名 | 中文 | 历史 |
|---|---|---|
| Helpful content system | 实用内容系统 | 2022 年推出,确保用户看到原创、实用、为人而写的内容;2024 年 3 月并入核心排名系统(core ranking systems) |
| Hummingbird | 蜂鸟 | 2013 年 8 月对整体排名系统的重大改进,后并入核心系统 |
| Panda | 熊猫 | 2011 年推出,呈现优质原创内容;2015 年并入核心系统 |
| Penguin | 企鹅 | 2012 年推出,防范垃圾链接(link spam);2016 年并入核心系统 |
注:抓取日期为 2026-08-02,退役列表经二次核实,当前页面仅含上述 4 项。
三、值得记住的官方事实
- 「核心更新」(core update)指对核心排名系统的更新,不是某个单独算法;2024 年 3 月起 helpful content system 不再独立存在,「内容是否实用」由核心系统直接评估。
- PageRank 仍在清单中,但只是链接分析系统的一部分;官方在新手指南中同时提醒不要只盯着它。
- Site diversity system 解释了为什么同一域名很难在首页占据两个以上位置。
- 排名更新的权威时间线在 Google Search Status Dashboard(见官方资源清单),2024 年 12 月后多数核心更新不再单独发博客。