知识库首页 知识库-人物 google-crawlers.md

google crawlers

本地来源:Knowledge/World/人物/seo方法论/google-seo/google-crawlers.md

Google Crawlers(Google 爬虫概述)

来源:https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

概述

Google 使用爬虫(Crawlers / Robots / Spiders)和抓取工具(Fetchers)来自动发现和扫描网站内容。爬虫是持续运行的自动程序,而抓取工具通常执行单次请求(类似 wget)。了解 Google 爬虫的工作机制对于 SEO 优化和网站技术配置至关重要。

核心功能

爬虫三大类型

1. 通用爬虫(Common Crawlers)

  • 用于 Google 核心产品(如 Googlebot)
  • 完全遵守 robots.txt 规则
  • 负责发现和索引网页内容
  • 代表性爬虫:Googlebot(网页)、Googlebot-Image(图片)、Googlebot-Video(视频)

2. 特殊爬虫(Special-case Crawlers)

  • 针对特定 Google 产品运行(如 AdsBot)
  • 在网站明确同意的情况下可忽略全局 robots.txt 通配符规则
  • 代表性爬虫:AdsBot(广告质量检查)、APIs-Google

3. 用户触发抓取工具(User-triggered Fetchers)

  • 由最终用户的操作请求触发
  • 如 Google Site Verifier(网站验证工具)
  • 不持续运行,按需执行

技术细节

传输协议支持

  • HTTP/1.1 和 HTTP/2
  • FTP 和 FTPS

内容编码支持

  • gzip 压缩
  • deflate 压缩
  • Brotli 压缩

文件大小限制

  • 默认抓取文件的前 15MB 内容
  • 超过 15MB 的部分会被忽略
  • 这意味着超大 HTML 文件底部的内容可能不会被索引

HTTP 缓存机制

  • 支持 ETagIf-None-Match
  • 支持 Last-ModifiedIf-Modified-Since
  • 合理使用缓存可以减少不必要的抓取开销

爬虫识别方式

  • HTTP User-Agent 请求头:每种爬虫有唯一的 User-Agent 字符串
  • 源 IP 地址:Google 爬虫使用固定的 IP 地址范围
  • 反向 DNS 主机名:可通过反向 DNS 查询验证爬虫身份(如 *.googlebot.com*.google.com

使用说明

如何验证 Googlebot 身份

  1. 对访问者 IP 执行反向 DNS 查询
  2. 确认主机名以 googlebot.comgoogle.com 结尾
  3. 对主机名执行正向 DNS 查询
  4. 确认解析的 IP 与原始 IP 一致

如何通过 robots.txt 控制爬虫

# 允许 Googlebot 抓取所有内容
User-agent: Googlebot
Allow: /

# 阻止 AdsBot 抓取特定目录
User-agent: AdsBot-Google
Disallow: /private/

关键信息

  • 抓取预算(Crawl Budget):Google 对每个网站有抓取频率限制,大型网站需要关注抓取预算的合理分配
  • 渲染能力:Googlebot 使用最新稳定版 Chrome 渲染 JavaScript,但渲染队列可能导致延迟
  • robots.txt 是建议而非强制:通用爬虫遵守 robots.txt,但恶意爬虫不会
  • 移动优先索引:Googlebot 主要使用移动端 User-Agent 进行抓取
  • IP 白名单:Google 公布了爬虫使用的 IP 地址范围,可用于防火墙配置

本文档为站内渲染。原始文件本地路径:saas/source/knowledge-people/Knowledge-World-人物-seo方法论-google-seo-google-crawlers-7fd820.md(仅本地保留,不入库不部署)