爬行、抓取、索引、收录
本地来源:seo-llm/SEO实战密码-markdown/第04章 网站结构优化/禁止抓取、索引机制/爬行、抓取、索引、收录.md
爬行、抓取、索引、收录
- 爬行
爬行指的是搜索引擎蜘蛛从已知页面上解析出链接指向的 URL,也就是沿着链接发现新页面(链接指向的 URL)的过程。当然,蜘蛛并不是发现新 URL 就马上爬过去抓取新页面,而是把发现的 URL 存放到待抓地址库中,按照一定顺序从地址库中提取要抓取的 URL。
- 抓取
抓取指的是搜索引擎蜘蛛从待抓地址库中提取要抓的 URL,访问这个 URL,把读取的 HTML 代码存入数据库的过程。蜘蛛抓取就是像浏览器一样打开这个页面,过程和用户浏览器访问一样,也会在服务器原始日志中留下记录。
- 索引
索引的英文是 index,指的是将一个 URL 的信息进行整理,并存入数据库,也就是索引库。用户搜索时,搜索引擎从索引库中提取 URL 信息并排序展现出来。索引库是用于搜索的,被索引的 URL 是可以被用户搜索到的,没有被索引的 URL,用户在搜索结果中是看不到的。
要注意的是,所谓“一个 URL 的信息”,并不限于蜘蛛从 URL 上抓取来的内容,还有来自其他来源的信息,如外部链接、链接的锚文字等。有的时候,索引库中根本没有从这个 URL 抓取来的内容,但搜索引擎知道这个 URL 的存在,并且有一些其他信息,那么这个 URL 也是已经被索引的。
- 收录
我个人觉得收录和索引没有区别,在本书里是混用的。只不过收录是从站长角度看的,搜索时能找到这个 URL,就是这个 URL 被收录了。从搜索引擎角度看,URL 被收录了,也就是这个 URL 的信息在索引库中存在了。英文中并没有收录这个词,它和索引使用的是同一个词 index。
有的时候,站长并不希望某些页面被收录(或者说被索引),如复制内容页面。网站上不出现链接,或者使用 JavaScript 链接,使用 nofollow 等方法都不能保证页面一定不被收录。站长自己虽然没有链接到不想被收录的页面,其他网站可能由于某种原因链接到这个页面,导致页面被抓取和收录。
有的时候,站长也不希望某些页面被抓取,如付费内容、还在测试阶段的网站等。还有一种很常见的情况,搜索引擎抓取了大量没有意义的页面,如电子商务网站按各种条件过滤、筛选的页面,各种排序、排版格式的页面,这些页面数量庞大,抓取过多会
消耗掉搜索引擎分配给这个网站的抓取份额,造成真正有意义的页面反倒不能被抓取和收录的情况。如果通过检查日志文件发现这些无意义页面被反复大量抓取,想要收录的页面却根本没被抓取过,那就应该直接禁止抓取无意义页面。
要确保页面不被抓取,需要使用 robots 文件。要确保页面不被索引,需要使用 noindex meta robots 标签。
本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/SEO实战密码-markdown-第04章-网站结构优化-禁止抓取-索引机制-爬行-抓取-索引-收录-0bbe21.md(仅本地保留,不入库不部署)