Google Crawlers(Google 爬虫概述)
来源:https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers
概述
Google 使用爬虫(Crawlers / Robots / Spiders)和抓取工具(Fetchers)来自动发现和扫描网站内容。爬虫是持续运行的自动程序,而抓取工具通常执行单次请求(类似 wget)。了解 Google 爬虫的工作机制对于 SEO 优化和网站技术配置至关重要。
核心功能
爬虫三大类型
1. 通用爬虫(Common Crawlers)
- 用于 Google 核心产品(如 Googlebot)
- 完全遵守 robots.txt 规则
- 负责发现和索引网页内容
- 代表性爬虫:Googlebot(网页)、Googlebot-Image(图片)、Googlebot-Video(视频)
2. 特殊爬虫(Special-case Crawlers)
- 针对特定 Google 产品运行(如 AdsBot)
- 在网站明确同意的情况下可忽略全局 robots.txt 通配符规则
- 代表性爬虫:AdsBot(广告质量检查)、APIs-Google
3. 用户触发抓取工具(User-triggered Fetchers)
- 由最终用户的操作请求触发
- 如 Google Site Verifier(网站验证工具)
- 不持续运行,按需执行
技术细节
传输协议支持
- HTTP/1.1 和 HTTP/2
- FTP 和 FTPS
内容编码支持
- gzip 压缩
- deflate 压缩
- Brotli 压缩
文件大小限制
- 默认抓取文件的前 15MB 内容
- 超过 15MB 的部分会被忽略
- 这意味着超大 HTML 文件底部的内容可能不会被索引
HTTP 缓存机制
- 支持
ETag和If-None-Match头 - 支持
Last-Modified和If-Modified-Since头 - 合理使用缓存可以减少不必要的抓取开销
爬虫识别方式
- HTTP User-Agent 请求头:每种爬虫有唯一的 User-Agent 字符串
- 源 IP 地址:Google 爬虫使用固定的 IP 地址范围
- 反向 DNS 主机名:可通过反向 DNS 查询验证爬虫身份(如
*.googlebot.com或*.google.com)
使用说明
如何验证 Googlebot 身份
- 对访问者 IP 执行反向 DNS 查询
- 确认主机名以
googlebot.com或google.com结尾 - 对主机名执行正向 DNS 查询
- 确认解析的 IP 与原始 IP 一致
如何通过 robots.txt 控制爬虫
# 允许 Googlebot 抓取所有内容
User-agent: Googlebot
Allow: /
# 阻止 AdsBot 抓取特定目录
User-agent: AdsBot-Google
Disallow: /private/
关键信息
- 抓取预算(Crawl Budget):Google 对每个网站有抓取频率限制,大型网站需要关注抓取预算的合理分配
- 渲染能力:Googlebot 使用最新稳定版 Chrome 渲染 JavaScript,但渲染队列可能导致延迟
- robots.txt 是建议而非强制:通用爬虫遵守 robots.txt,但恶意爬虫不会
- 移动优先索引:Googlebot 主要使用移动端 User-Agent 进行抓取
- IP 白名单:Google 公布了爬虫使用的 IP 地址范围,可用于防火墙配置
本文档为站内渲染。原始文件本地路径:saas/source/seo/SEO-seo方法论-google-seo-google-crawlers-ec8135.md(仅本地保留,不入库不部署)