禁止 AI 抓取网站内容
本地来源:seo-llm/SEO实战密码-markdown/第09章 人工智能与 SEO/优化搜索页面的 AI 回答/禁止 AI 抓取网站内容.md
禁止 AI 抓取网站内容
另一个影响 AI 回答的方法是禁止自己的内容被抓取和用于训练。
为什么要禁止 AI 抓取网站内容?对大部分网站来说,最简单直接的原因就是还没有明确有效的方式得到回报。
就目前的情况看,AI 抓取内容和搜索引擎抓取内容还有点不一样。搜索引擎抓取内容后会带给网站流量,SEO 们想尽办法让搜索引擎多抓而不得。AI 把网站内容用于训练后,网站能得到什么还不确定。ChatGPT、Gemini、文心一言的聊天机器人基本上是不注明出处的,更没有链接,所以网站得不到流量。
Copilot、SGE、百度新搜索,出现生成式 AI 回答时都是会给出出处链接的,网站可以得到流量。但 Bing 市场份额太小,SGE 目前依然处于实验项目阶段,百度 AI 伙伴暂时下线,网站未来从 AI 回答中能得到多少流量还不确定。
大公司更要考虑版权、数据安全、隐私等更严重的问题。
比如,新闻网站,雇用记者、编辑创造新闻内容的成本是很高的,作品是有明确版权归属的,AI 系统不经允许用作训练,出现在聊天机器人的回答中,甚至后续出现在其他网站上,这是有侵犯版权嫌疑的。2023 年 12 月,纽约时报起诉 ChatGPT 及微软在未经授权的情况下将其百万篇级别的文章用于聊天机器人训练,并将信息提供给用户。起诉 ChatGPT 的还有作家、画家、音乐创作者等。目前法官还没有裁定生成式 AI 将有版权的资料当作训练数据是否符合“公平使用”原则。
不允许 AI 使用,也可以避免误用,避免自己的内容/品牌与其他有害信息产生关联。再如,垂直领域或有自己独特产品的电商网站,很多会认真地写原创产品描述,他
们肯定不愿意自己的原创内容被抓取、用于训练、生成 AI 内容,进而被其他网站使用。由于蜘蛛爬行、抓取能力强悍,可能在网站上发现本不应该泄露的信息。已经发生
多起生成式 AI 抓取信息后在聊天中透露用户名/密码、个人信息、付款信息之类的事件,对某些网站来说,这是很可怕的潜在危险。有些网站的用户信息是可以随意查看、抓取的,再加上 AI 的数据挖掘、学习能力,用户隐私被泄露的可能性不能被排除。
不仅不能让 AI 抓取敏感信息,在与生成式 AI 聊天时,也千万不能透露个人或敏感信息。
如果不想让 AI 将自己的网站内容用于训练,可以禁止 AI 蜘蛛抓取页面。讨论了各种方法后,AI 巨头们显然都意识到用 robots 文件禁止是最方便的方法。当然,和其他蜘蛛一样,需要登录账号、有密码保护的内容,AI 蜘蛛也是抓取不到的。
2023 年 8 月 7 日,OpenAI 发布其抓取蜘蛛的新名字——GPTBot,网站可以像禁止其他蜘蛛一样,用 robots 文件禁止 GPTBot 抓取:
User-agent: GPTBot Disallow: /
不过这里有个模糊的地方:ChatGPT 的训练数据来源不限于 GPTBot 抓取的数据。
OpenAI 的官方文件显示,ChatGPT 训练数据来源有三类:
- 网上的公开信息,这是可以用 robots 文件禁止的那部分。
- 来自第三方的授权信息,这个第三方都包括谁,OpenAI 并没有披露。
- OpenAI 的用户及人类训练员提供的信息。用户使用 ChatGPT 时输入的内容会被用于进一步训练。用户可以在账号设置中选择禁止ChatGPT 将用户输入内容用于训练。
由于第二个来源中的第三方是谁并不清楚,使用 robots 文件禁止 GPTBot 抓取并不能保证网站内容 100%不被用于训练。
2023 年 9 月 28 日,Google 发布其用于 AI 训练的专用蜘蛛名字:Google-Extended,同样可以用 robots 文件简单禁止:
User-agent: Google-Extended Disallow: /
Google 的用词是,用 robots 文件禁止了Google-Extended 蜘蛛,就禁止了 Bard/Gemini
和 Vertex AI(Google 开放给用户使用的云端机器学习平台),以及今后所有用于这些产品的模型。因此,禁止了 Google-Extended 就应该彻底不会被用于 Google 的 AI 训练了。
Google 显然不希望网站禁止其 AI 蜘蛛,但又不得不提供禁止机制,所以 Google 在官方文件中说“通过控制 Google-Extended,网站可以选择是否要帮助 AI 模型成长”,把允许 AI 训练上升到帮助 AI 成长的高度了。
要注意的是,使用 robots 文件禁止 AI 蜘蛛抓取,只是禁止 AI 模型将内容用于训练,并不禁止网站出现在搜索结果页面的 AI 回答中。
另外,AI 蜘蛛也会自行屏蔽一些内容,如仇恨/歧视言论、成人内容、个人信息等。那么有哪些网站使用robots 文件禁止 AI 蜘蛛了呢?2023 年 9 月 22 日,Originality.ai
发布帖子,统计了前 1000 名大网站禁止 GPTBot 等 AI 蜘蛛的情况,前 1000 名大网站中已经有 242 个禁止了 GPTBot 的使用,占能检查到 robots 文件的 933 个网站的 26%。其中包括 Amazon、Pinterest、Quora、纽约时报、CNN、华盛顿邮报、路透社等。
图 9-27 是 Originality.ai 持续更新的截至 2024 年 3 月禁止 AI 蜘蛛抓取的网站数量变化曲线。

图 9-27 禁止 AI 蜘蛛抓取的网站数量变化曲线
图里的 CCBot 是 Common Crawl 的蜘蛛,一个非营利组织的大型网站数据库,2008年就成立了。很多 AI 是用 CC 数据库训练的,说不定也是 OpenAI 的第三方数据提供商之一,因此 CCBot 也被不少网站禁止了。禁止 CCBot 的方法是一样的:
User-agent: CCBot Disallow: /
可以看到,禁止 AI 蜘蛛抓取的网站数量还在缓慢增长中。截至 2024 年 3 月,前 1000
名大网站中有32.2%禁止了GPTBot,17.8%禁止了CCBot,10.2%禁止了Google-Extended。新闻网站是最倾向于禁止 AI 蜘蛛的。
读者可以在本书补充资源页面查看 Originality.ai 公布的最新数据。目前没有看到屏蔽百度 Ernie 蜘蛛的信息。
我个人目前不会禁止 AI 蜘蛛抓取。自己的内容被 AI 用于训练,即使暂时没有好处,除了心有不甘,也并没有明显坏处。而且,训练数据中的内容和网站未来是否会在 AI 搜索中占有一定优势还未可知,除非有安全、版权、隐私等更重大问题,个人认为还是先不要拒绝这种可能性为好。
本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/SEO实战密码-markdown-第09章-人工智能与-SEO-优化搜索页面的-AI-回答-禁止-AI-抓取网站内容-f41d0e.md(仅本地保留,不入库不部署)