google crawlers.md
本地来源:seo-llm/raw/seo知识库/TXT整理/seo方法论/google-seo/google-crawlers.md.txt
# Google Crawlers(Google 爬虫概述) > 来源:https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers ## 概述 Google 使用爬虫(Crawlers / Robots / Spiders)和抓取工具(Fetchers)来自动发现和扫描网站内容。爬虫是持续运行的自动程序,而抓取工具通常执行单次请求(类似 wget)。了解 Google 爬虫的工作机制对于 SEO 优化和网站技术配置至关重要。 ## 核心功能 ### 爬虫三大类型 #### 1. 通用爬虫(Common Crawlers) - 用于 Google 核心产品(如 Googlebot) - **完全遵守 robots.txt 规则** - 负责发现和索引网页内容 - 代表性爬虫:Googlebot(网页)、Googlebot-Image(图片)、Googlebot-Video(视频) #### 2. 特殊爬虫(Special-case Crawlers) - 针对特定 Google 产品运行(如 AdsBot) - 在网站明确同意的情况下可忽略全局 robots.txt 通配符规则 - 代表性爬虫:AdsBot(广告质量检查)、APIs-Google #### 3. 用户触发抓取工具(User-triggered Fetchers) - 由最终用户的操作请求触发 - 如 Google Site Verifier(网站验证工具) - 不持续运行,按需执行 ## 技术细节 ### 传输协议支持 - HTTP/1.1 和 HTTP/2 - FTP 和 FTPS ### 内容编码支持 - gzip 压缩 - deflate 压缩 - Brotli 压缩 ### 文件大小限制 - 默认抓取文件的**前 15MB** 内容 - 超过 15MB 的部分会被忽略 - 这意味着超大 HTML 文件底部的内容可能不会被索引 ### HTTP 缓存机制 - 支持 `ETag` 和 `If-None-Match` 头 - 支持 `Last-Modified` 和 `If-Modified-Since` 头 - 合理使用缓存可以减少不必要的抓取开销 ### 爬虫识别方式 - **HTTP User-Agent 请求头**:每种爬虫有唯一的 User-Agent 字符串 - **源 IP 地址**:Google 爬虫使用固定的 IP 地址范围 - **反向 DNS 主机名**:可通过反向 DNS 查询验证爬虫身份(如 `*.googlebot.com` 或 `*.google.com`) ## 使用说明 ### 如何验证 Googlebot 身份 1. 对访问者 IP 执行反向 DNS 查询 2. 确认主机名以 `googlebot.com` 或 `google.com` 结尾 3. 对主机名执行正向 DNS 查询 4. 确认解析的 IP 与原始 IP 一致 ### 如何通过 robots.txt 控制爬虫 ``` # 允许 Googlebot 抓取所有内容 User-agent: Googlebot Allow: / # 阻止 AdsBot 抓取特定目录 User-agent: AdsBot-Google Disallow: /private/ ``` ## 关键信息 - **抓取预算(Crawl Budget)**:Google 对每个网站有抓取频率限制,大型网站需要关注抓取预算的合理分配 - **渲染能力**:Googlebot 使用最新稳定版 Chrome 渲染 JavaScript,但渲染队列可能导致延迟 - **robots.txt 是建议而非强制**:通用爬虫遵守 robots.txt,但恶意爬虫不会 - **移动优先索引**:Googlebot 主要使用移动端 User-Agent 进行抓取 - **IP 白名单**:Google 公布了爬虫使用的 IP 地址范围,可用于防火墙配置
本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/raw-seo知识库-TXT整理-seo方法论-google-seo-google-crawlers-md-5073f1.txt(仅本地保留,不入库不部署)