训练人工智能搜索算法
本地来源:seo-llm/SEO实战密码-markdown/第09章 人工智能与 SEO/人工智能搜索算法原理/训练人工智能搜索算法.md
训练人工智能搜索算法
搜索引擎并没有公开描述人工智能搜索算法的训练方法。根据搜索工程师的简单介绍及我对 AI 的粗浅理解,人工智能搜索算法的大致训练方法猜测如下。
搜索引擎可以把有标注的搜索数据分成两组:一组用于训练,另一组用于验证。
AI 模型辨别训练组搜索结果中的页面有哪些特征,这些特征又应该给予什么样的权重,由 AI 学习、拟合出某种计算公式,按照这个公式,AI 模型计算出的高质量页面和高质量搜索结果与用户做的标注刚好一致。
与传统算法不同的是,需要考虑哪些特征(排名因素),这些特征给予多少权重,不一定是工程师决定的,更多是 AI 系统自己学习的。这些因素也许是工程师想得到、早就在用的,比如:
- 页面正文是否出现关键词。
- 页面标题是否出现关键词。
- 页面上有没有广告。
- 页面有多少外部链接。
- 页面有多少内部链接。
- 页面有多少以查询词为锚文字的链接。
- 页面所在域名有多少外部链接。
- 页面打开速度有多快。
……
可能有成百上千个。
有些是工程师从没想过的,有些是表面上看起来毫无关系、毫无道理的,比如:
- 页面正文用的几号字。
- 文章作者名字是几个字。
- 页面第一次被抓取是星期几。
- 页面外部链接数是奇数还是偶数。
以上只是举例,为了说明 AI 寻找的不是因果关系,而是相关关系。只要 AI 学习到排名好的页面有哪些特征就够了,至于把这些特征与排名联系起来是不是看着有道理,并不是 AI 关心的。
其中,有些因素可能是负面的,比如域名长度很可能与高排名是负相关的。
AI系统被训练的过程就是找到这些排名因素(无论人类看着是否有道理),给予这些因素一定权重,拟合出排名算法,刚好能得到用户满意的那个搜索结果。这个拟合过程应该是迭代的,从一套排名因素、权重数值、模型参数开始,一次不行,则自动调整参数,再次计算,直到比较完美地拟合出用户做过标注的搜索结果。这个训练过程也许要几天,也许要几个星期,要看数据量和硬件算力。
本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/SEO实战密码-markdown-第09章-人工智能与-SEO-人工智能搜索算法原理-训练人工智能搜索算法-ae2bbe.md(仅本地保留,不入库不部署)