知识库首页 seo-llm 资料 google-crawlers.md.txt

google crawlers.md

本地来源:seo-llm/raw/seo知识库/TXT整理/seo方法论/google-seo/google-crawlers.md.txt

# Google Crawlers(Google 爬虫概述)

> 来源:https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

## 概述

Google 使用爬虫(Crawlers / Robots / Spiders)和抓取工具(Fetchers)来自动发现和扫描网站内容。爬虫是持续运行的自动程序,而抓取工具通常执行单次请求(类似 wget)。了解 Google 爬虫的工作机制对于 SEO 优化和网站技术配置至关重要。

## 核心功能

### 爬虫三大类型

#### 1. 通用爬虫(Common Crawlers)

- 用于 Google 核心产品(如 Googlebot)
- **完全遵守 robots.txt 规则**
- 负责发现和索引网页内容
- 代表性爬虫:Googlebot(网页)、Googlebot-Image(图片)、Googlebot-Video(视频)

#### 2. 特殊爬虫(Special-case Crawlers)

- 针对特定 Google 产品运行(如 AdsBot)
- 在网站明确同意的情况下可忽略全局 robots.txt 通配符规则
- 代表性爬虫:AdsBot(广告质量检查)、APIs-Google

#### 3. 用户触发抓取工具(User-triggered Fetchers)

- 由最终用户的操作请求触发
- 如 Google Site Verifier(网站验证工具)
- 不持续运行,按需执行

## 技术细节

### 传输协议支持

- HTTP/1.1 和 HTTP/2
- FTP 和 FTPS

### 内容编码支持

- gzip 压缩
- deflate 压缩
- Brotli 压缩

### 文件大小限制

- 默认抓取文件的**前 15MB** 内容
- 超过 15MB 的部分会被忽略
- 这意味着超大 HTML 文件底部的内容可能不会被索引

### HTTP 缓存机制

- 支持 `ETag` 和 `If-None-Match` 头
- 支持 `Last-Modified` 和 `If-Modified-Since` 头
- 合理使用缓存可以减少不必要的抓取开销

### 爬虫识别方式

- **HTTP User-Agent 请求头**:每种爬虫有唯一的 User-Agent 字符串
- **源 IP 地址**:Google 爬虫使用固定的 IP 地址范围
- **反向 DNS 主机名**:可通过反向 DNS 查询验证爬虫身份(如 `*.googlebot.com` 或 `*.google.com`)

## 使用说明

### 如何验证 Googlebot 身份

1. 对访问者 IP 执行反向 DNS 查询
2. 确认主机名以 `googlebot.com` 或 `google.com` 结尾
3. 对主机名执行正向 DNS 查询
4. 确认解析的 IP 与原始 IP 一致

### 如何通过 robots.txt 控制爬虫

```
# 允许 Googlebot 抓取所有内容
User-agent: Googlebot
Allow: /

# 阻止 AdsBot 抓取特定目录
User-agent: AdsBot-Google
Disallow: /private/
```

## 关键信息

- **抓取预算(Crawl Budget)**:Google 对每个网站有抓取频率限制,大型网站需要关注抓取预算的合理分配
- **渲染能力**:Googlebot 使用最新稳定版 Chrome 渲染 JavaScript,但渲染队列可能导致延迟
- **robots.txt 是建议而非强制**:通用爬虫遵守 robots.txt,但恶意爬虫不会
- **移动优先索引**:Googlebot 主要使用移动端 User-Agent 进行抓取
- **IP 白名单**:Google 公布了爬虫使用的 IP 地址范围,可用于防火墙配置

本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/raw-seo知识库-TXT整理-seo方法论-google-seo-google-crawlers-md-5073f1.txt(仅本地保留,不入库不部署)