SEO 专题 基于 Google 官方一手资料 codeflow.cc

Google 搜索工作原理与排名系统研究笔记

来源(官方,已验证可访问):

一、搜索的三个阶段

官方将 Google 搜索的工作流程分为三个阶段,并强调:三个阶段并非每个网页都会经历全部;Google 不保证抓取、索引或展示任何网页,即使它符合搜索要素。

flowchart LR
  A[网址发现] --> B[抓取 Crawling]
  B --> C[编入索引 Indexing]
  C --> D[呈现 Serving]
  B -.障碍.-> X1[robots.txt / 服务器错误 / 需登录]
  C -.障碍.-> X2[noindex / 质量过低 / JS 问题]
  D -.障碍.-> X3[与查询无关 / 质量低 / 呈现规则阻止]

阶段 1:抓取(Crawling)

  • 执行抓取的程序是 Googlebot(也称 crawler、robot、spider),从互联网发现网页并下载文本、图片和视频。
  • 不存在中央网页注册表,Google 需要持续做网址发现(URL discovery),途径:已知网页上的链接(如类别页链到新博文)、站长提交的站点地图(sitemap)。
  • Googlebot 用算法决定抓取哪些网站、抓取频率(crawl rate)、每站抓取的网页数,并根据网站响应调整(如遇到 HTTP 500 错误则降低抓取速度)。
  • 抓取时 Google 使用最新版 Chrome **渲染(render)**网页并运行其中的 JavaScript——因为许多网站依赖 JavaScript 呈现内容。
  • 常见抓取障碍:服务器问题、网络问题、robots.txt 规则阻止、需要登录才能访问的页面。

阶段 2:编入索引(Indexing)

  • 处理和分析文字内容及关键内容标记和属性:<title> 元素、alt 属性、图片、视频等。
  • Google 判断网页是否为重复内容:将内容相似的网页聚类(clustering),选出最具代表性的规范网页(canonical),其余作为备用版本在不同情境下呈现。
  • 同时收集关于规范网页的信号(signals):页面语言、内容针对的国家/地区、网页易用性等。
  • 信息存储在 Google 索引(Google index)——托管在数千台计算机上的大型数据库。
  • 不被索引的常见原因:内容质量低、robots meta 规则禁止索引、网站设计问题(尤其 JavaScript)。

阶段 3:呈现搜索结果(Serving search results)

  • 排名完全程序化(programmatically),Google 不收费提升排名。
  • 相关性(relevancy)由数百个因素决定,包括用户的位置、语言、设备。官方例子:搜索「自行车维修店」,巴黎与香港用户结果不同。
  • 搜索功能(search features)随查询变化:搜「自行车维修店」显示本地结果而非图片;搜「现代自行车」则显示图片。
  • 已被索引但不显示的可能原因:内容与查询无关、内容质量低、robots meta 规则阻止呈现。

二、官方承认的排名系统(Ranking Systems)

来自官方《排名系统指南》。这份文档的价值在于:它是 Google 唯一一份逐个列出在用排名系统的清单,可以直接反驳大量第三方 SEO 传言。

当前使用的系统(17 个)

英文原名中文一句话说明
BERT (Bidirectional Encoder Representations from Transformers)基于 Transformer 的双向编码模型,理解字词不同组合表达的不同含义与意图
Crisis information systems危机信息系统危机时刻提供及时实用信息,含个人危机(personal crisis)与 SOS 警报(SOS Alerts)子系统
Deduplication systems重复信息删除系统避免展示过度相似的网页
Exact match domain system完全匹配网域系统避免过度看重域名与查询词完全匹配的网站
Freshness systems时效性系统对时效性查询按用户预期显示较新内容
Link analysis systems and PageRank链接分析系统和 PageRank通过网页间链接判断网页内容和实用程度
Local news systems本地新闻系统识别并及时展示相关本地新闻来源
MUM (Multitask Unified Model)多任务统一模型能理解和生成语言的 AI 系统,仅用于特定用途(如改进疫苗信息搜索),不用于一般排名
Neural matching神经匹配理解查询和网页中概念的表示并相互匹配
Original content systems原创内容系统让原创内容(含原创报道)优先于仅引用它的内容
Removal-based demotion systems基于移除的降位系统根据大量有效内容移除要求对网站降位
Passage ranking system段落排名系统识别网页中的段落(passages),更精细地判断相关性
RankBrain理解字词与概念的关系,内容不含查询确切字词也能匹配
Reliable information systems可靠信息系统多系统协同展示最可靠信息,对低可靠性情形给出内容警示
Reviews system评价系统奖励包含深刻分析和原创研究的优质评价内容
Site diversity system网站多元化系统一般不在靠前结果中显示同一网站超过两个网页
Spam detection systems垃圾内容检测系统多个系统(包括 SpamBrain)处理违反垃圾内容政策的内容和行为

已退役的系统(4 个,功能已并入核心排名系统)

英文原名中文历史
Helpful content system实用内容系统2022 年推出,确保用户看到原创、实用、为人而写的内容;2024 年 3 月并入核心排名系统(core ranking systems)
Hummingbird蜂鸟2013 年 8 月对整体排名系统的重大改进,后并入核心系统
Panda熊猫2011 年推出,呈现优质原创内容;2015 年并入核心系统
Penguin企鹅2012 年推出,防范垃圾链接(link spam);2016 年并入核心系统

注:抓取日期为 2026-08-02,退役列表经二次核实,当前页面仅含上述 4 项。

三、值得记住的官方事实

  • 「核心更新」(core update)指对核心排名系统的更新,不是某个单独算法;2024 年 3 月起 helpful content system 不再独立存在,「内容是否实用」由核心系统直接评估。
  • PageRank 仍在清单中,但只是链接分析系统的一部分;官方在新手指南中同时提醒不要只盯着它。
  • Site diversity system 解释了为什么同一域名很难在首页占据两个以上位置。
  • 排名更新的权威时间线在 Google Search Status Dashboard(见官方资源清单),2024 年 12 月后多数核心更新不再单独发博客。