知识库首页 seo-llm 资料 与人工智能有关的词汇和概念.md

与人工智能有关的词汇和概念

本地来源:seo-llm/SEO实战密码-markdown/第09章 人工智能与 SEO/人工智能的发展与搜索/与人工智能有关的词汇和概念.md

与人工智能有关的词汇和概念

目前实现人工智能的主流方法是机器学习中的深度学习分支。前两次 AI 浪潮的成果和方法原理,SEO 人员就不必深究了。但深度学习方法是需要大致了解的,这对理解人工智能搜索算法至关重要。

先声明一下,下面涉及的深度学习等概念,很可能我的理解和表述是非常粗浅的,甚至是有偏差的。虽然我也是学理工科出身的,但那是 30 年前的事了。想了解人工智能准确细节的读者,请以专业资料为准。这里讨论的只以对 SEO 来说够用为标准。

机器学习(Machine Learning)是人工智能的一个分支,主要方法是让计算机自己学习,而不是按工程师编写好的程序运行。机器学习和大数据又紧密相关,因为机器学习需要给系统输入大量数据,系统进行自主学习并不断调整参数、增强功能,输入数据越多,结果越准确。

机器学习 AI 模型可以理解为是由大量参数组成的极复杂函数。机器学习模型训练过程中需要数据,但模型本身并不包含或存储训练数据,而是在学习过程中不断调整其参数,以反映从训练数据中学习到的东西,也就是拟合输出和输入之间的关系。ChatGPT发布时是基于 GPT-3.5 的,GPT-3.5 有 1750 亿个参数。

神经网络是机器学习的一种高级技术,其算法模仿了人类大脑结构,用大量计算单元模拟神经元,组成神经层,多个神经层再叠加、连接。神经网络层数越多,也就被理解为越“深”,所以又有了深度学习(Deep Learning)的概念。

神经网络并不是人脑,不能直接产生智能,需要用大量有标注的数据进行训练。比如,Google Brain 最初的训练任务是判断图片里的物体是不是猫,需要先收集大量打了标注的图片(标注是或不是猫),把图片当作训练数据。神经网络进行判断时,最初就是瞎猜,然后与标注对比,神经网络就知道判断是否正确。经过大量判断和反馈训练后,

神经网络参数会自动调整,直到能正确判断出图片里的物体是不是猫。

由于被标注的数据在很多领域不一定能轻易获得,所以 Google Brain 也研究了 AI 系统的自我学习,使用未标注的图片(来自 Youtube 视频抓图)对神经网络进行训练,一星期后,神经网络开始自己意识到猫应该长什么样子。

因此,机器学习又分为监督式学习和无监督式学习。监督式学习就是用有标注的数据进行训练,数据包含了输入和实际输出或期望输出,AI 系统经过训练,自行发现输入和输出之间的关系,因此可以预测有新的输入时应该给出什么输出。无监督式学习就是用没有标注的数据进行训练,可以发现隐藏的模式或结构。

大语言模型(Large Language Models,LLM)就是一种深度神经网络构建的语言模型,用于理解和生成人类语言,使用无监督学习方法通过大量无标注文本进行训练,通常有数百亿或更多参数。

神经网络虽然模仿了人脑,但其工作方式和人脑是很不同的,即使 AI 工程师也不是十分清楚神经网络到底是怎样判断的,甚至不能肯定神经网络是真的知道猫的样子而判断正确,还是依据别的什么人类没注意到的线索而判断正确。不过,这并不影响 AI 判断的正确率极高这个确定的事实。

吴军老师在《智能时代》中有句话,可以特别贴切地用于理解这种情形(大意):“在智能时代,可以在大数据中直接找到答案,虽然可能不知道原因。”

当大模型参数达到一个临界点后,会出现“涌现”(Emergence)现象,也就是较大的模型突然出现了较小的模型没有的且不在预料中的能力,或者说质的突变。如本章后面会讨论的,生成式AI 本质上是计算概率,但每次使用ChatGPT 等聊天机器人时,我还是无法相信,这么一个简单的数学原理,竟然使 AI 能明白且能这么通顺地回答我的问话了。这是AI 神秘又有些危险的地方,如果有一天AI 涌现出我们称为意识的东西怎么办?

本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/SEO实战密码-markdown-第09章-人工智能与-SEO-人工智能的发展与搜索-与人工智能有关的词汇和概念-234f53.md(仅本地保留,不入库不部署)