充分利用抓取份额
本地来源:seo-llm/SEO实战密码-markdown/第04章 网站结构优化/大型网站抓取份额管理/充分利用抓取份额.md
充分利用抓取份额
中小网站不用担心抓取份额的问题。如果几万个页面还不能做到充分抓取,那说明页面质量太低,或链接结构存在重大问题。
百万页面以上级别的网站,可能要考虑抓取份额的问题。抓取份额不够,比如网站有一千万个页面,搜索引擎每天只抓取几万个页面,那么把网站抓取一遍可能需要几个月,甚至一年,也可能意味着一些页面长期不能被抓取,所以也就无法获得排名和流量。
提高和充分利用抓取份额需要考虑以下几方面。
首先是文件下载速度。如前文中所述,抓取份额是蜘蛛抓取时间上限,不是抓取页面数上限。服务器慢,文件下载时间长,将直接导致蜘蛛在单位时间内能抓取的页面数下降。越是大网站,越是要提高服务器性能、增加带宽、布局 CDN、优化代码、优化数据库、压缩图片、减少非必要功能,不然即使有海量高质量数据,搜索引擎蜘蛛也无法大量抓取。
其次是良好的网站结构,使搜索引擎能够通过内部链接发现页面,且页面被分配到一定的权重。提交、更新 sitemap.xml 有助于搜索引擎发现 URL,但大网站远远不能靠 sitemap.xml 抓取。
再次是禁止搜索引擎蜘蛛抓取低质量页面和重复内容。抄袭、转载、伪原创一类的垃圾内容自不必说。有些页面用户是需要的,也不能说是低质量,但对搜索引擎来说是重复内容,是浪费资源,比如各种排序方式、显示格式、过滤筛选页面、万年历系统等。这些功能很容易就生成巨量页面,不要把有限的抓取份额浪费在这些无意义的页面抓取
上,导致应该被抓取的重要页面却没有机会被抓取。同时,搜索引擎不想浪费资源,抓取这类无意义页面多了,会自动降低抓取份额。如前面几节讨论的,禁止抓取的最好方法是使用 robots 文件。某些情况下使用 nofollow 链接也可以大幅减少抓取。页面使用 noindex 标签对禁止抓取是没有用的。页面使用 canonical 标签也不能禁止抓取。
最后还要避免短时间内大量删除页面。虽然下线产品、清理过时内容是很正常的行为,但如果搜索引擎蜘蛛抓取的页面很大比例已被删除,就会对网站质量有所怀疑,进而降低抓取份额。少量删除的页面确保返回 404 或 410 状态码,这是让搜索引擎真正停止抓取的最快方法。
本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/SEO实战密码-markdown-第04章-网站结构优化-大型网站抓取份额管理-充分利用抓取份额-0b9640.md(仅本地保留,不入库不部署)