人工智能用于搜索
本地来源:seo-llm/SEO实战密码-markdown/第09章 人工智能与 SEO/人工智能搜索算法原理/人工智能用于搜索.md
人工智能用于搜索
AlphaGo 下围棋与搜索排名要解决的问题看似相隔甚远,但其本质对 AI 来说是非常相像的,是可以用同一种方式解决的。
- AlphaGo 通过学习无数棋局,其中有人类的历史棋局,更多的是 AlphaGo 自我对局,累积海量数据,训练 AI 在面对某一盘面时做出判断:下一手,在哪里落子胜率最高?
- 搜索算法通过学习页面索引库、搜索日志、用户访问数据、质量评估员打分等,训练 AI 在面对页面和搜索结果时做出判断:这个页面是高质量还是低质量的?这个搜索结果是高质量还是低质量的?
传统搜索算法由工程师根据常识、工程知识、情怀、用户反馈等情况,选出排名因素,调整排名因素的权重,按既定的公式计算结果。传统方法的一个弊端是,当系统复杂到一定程度后,调整排名因素及其权重是件很困难的事。例如,降低一个排名因素的权重,可能会造成其他因素重要性相对上升,进而导致无法预见的结果。调整多个因素时,更是无法预期因素之间的相互作用和最终结果。
而从海量数据中寻找模式或规律,并在新场景中预测结果正是 AI 擅长的工作。以人工智能为基础的算法不需要工程师告诉它使用什么排名因素,而是会自我学习用哪些排名因素,以及它们各占多少权重。
在传统搜索算法中,工程师要知道原因才能写算法。而 AI 直接从数据中找答案,不需要工程师知道原因。
AI 算法通过大量做了标注的数据进行训练,自我学习,寻找模式和规律。比如,在围棋中,AI 系统有大量棋局数据,以及这些棋局的输赢结果,这个结果就是标注。然后 AI 系统自我学习棋局盘面与结果(输赢)之间的关系。
在搜索中,AI 系统有海量页面数据,也就是搜索引擎本身的索引库,还需要标注,也就是要知道哪些页面是高质量的,哪些搜索结果是用户满意的,然后 AI 算法自我学习页面特征(也就是排名因素)与高质量页面及排名之间的关系。
既然训练人工智能搜索算法时需要做了标注的数据,那么这些有标注的数据是从哪来的?以下几个是可能的数据来源。
- 搜索日志
搜索引擎都有很详细的日志,查询词、查询时间、查询用户的信息,哪些页面排名在第几位,各页面点击率、快速返回比例,重新组织查询词等。日志数据在一定程度上表现出用户对页面相关性、可靠性、质量等的判断。比如,页面点击率高、返回率低,大概率说明页面质量高,符合用户查询需求。所以,搜索日志就相当于真实搜索用户做的标注。
- 上线算法更新时的测试数据
搜索引擎正式上线新算法前通常会做测试,给部分用户返回新算法结果,除了监测和正常搜索一样的点击率、返回率等,还可以对比不同算法的总点击率、返回结果页面并调整查询词的比例等数据,以判断新算法的有效性。这些测试日志在一定程度上体现出用户对新算法搜索结果质量的判断,也可以当作用户给出的标注。如总点击率高,重新调整查询词比例低,说明新算法搜索结果质量有改进。
- 用户访问数据
除了搜索日志,搜索引擎还可以通过各种方式,如流量统计服务、自己的浏览器、浏览器工具条、购买 ISP 数据等,收集用户访问网站时的浏览数据,了解用户的真实体验。如页面打开速度、用户停留时间、访问深度、链接点击分布、网站其他来源的流量,甚至转化率等,这些都是真实用户对特定页面和网站质量做出的标注。
- 人工质量评估员
Google 和Bing 都有人工质量评估员,他们是真实的普通用户,不是搜索引擎员工。
在学习、培训质量评估方法后,评估系统让评估员查看真实网站、真实查询词搜索结果,然后打分,最主要的就是:
- 给页面质量打分。
- 给特定查询词的搜索结果打分。
搜索引擎的质量评估员很早就存在了,不是为了开发 AI 算法招募的,而是日常用来评估算法有效性的。评估员数据刚好就是真实用户做的标注,可以用来训练AI 系统。
百度是否有人工质量评估员不得而知。我的猜测是没有,百度很可能主要依靠日志、访问和测试数据。
搜索引擎本来就有海量页面特征数据,现在,AI 系统也有了真实用户做了标注的输出数据,下一步就是训练 AI 模型,寻找页面特征和高质量搜索结果之间的关系。
本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/SEO实战密码-markdown-第09章-人工智能与-SEO-人工智能搜索算法原理-人工智能用于搜索-87dd6d.md(仅本地保留,不入库不部署)