采集和伪原创
本地来源:seo-llm/SEO实战密码-markdown/第10章 SEO 作弊及惩罚/主要 SEO 作弊方法/采集和伪原创.md
采集和伪原创
采集就是把别人网站上的内容搬到自己网站来。通常使用程序自动采集。如果采集后发布在自己网站时留下原出处链接,还可以称得上是转载,但国内几乎没人会保留链接。采集后不提原出处,就冒充是自己的原创内容发布,在国内属于常态,所以采集差不多就是大规模自动抄袭。
单纯采集过来就发布其实很难获得排名,除非是高权重网站。所以采集来的内容经常还要做伪原创,也就是进行少量文字性的修改,试图让搜索引擎误认为是原创内容。伪原创也经常是通过软件完成的。伪原创是近年国内 SEO 圈子里的热门话题,也是应用很广的作弊方法。
我个人反对采集和伪原创,这是明确侵犯他人版权的行为,与尊重版权的转载是有本质区别的。所以本书不介绍采集和伪原创软件,只是从 SEO 角度讨论使用的方法和搜索引擎的处理。
伪原创常见的手法如下。
- 更改、重写标题。
- 颠倒段落次序。
- 从多篇文章抽取段落,整合为一篇文章。
- 加入一段原创,如在最前面加一段内容提要。
- 文字简单增减,如感叹词、修饰语。
- 同义词、近义词替换。
- 强行插入关键词,如在一篇小说中插入关键词。用户体验极差。
伪原创的水平足够高,有时可以骗过搜索引擎,获得不错的排名。但是简单使用上面列出的方法是骗不了搜索引擎的,2.4 节中介绍的“去重”过程就可以很好地鉴别伪原创。
“去重”的基本方法是对页面特征关键词计算数字指纹,也就是说从页面主体内容中选取最有代表性的一部分关键词(经常是出现频率最高的关键词),然后计算这些关键词的指纹。这里的关键词选取发生在分词、去停止词、消噪之后。
典型的指纹计算方法如 MD5 算法(消息摘要算法第五版)。这类指纹算法的一个特点是,输入(特征关键词及其顺序)有任何微小的变化,都会导致计算出的哈希值,也就是数字指纹出现巨大差异。每个页面正文都计算哈希值后,页面的对比就变成了哈希值的对比。哈希值相同,指纹相同,说明页面内容相同。指纹算法就是为了验证文件是否被篡改的,鉴别重复内容是另一种方式的应用。
了解了搜索引擎的去重算法,SEO 人员就应该知道简单地增加“的”“地”“得”,调换段落顺序这种所谓的伪原创方法,并不能帮助逃过搜索引擎的去重算法,因为这样的操作无法改变文章的指纹。而且搜索引擎的去重算法很可能不止于页面级别,而是进行到段落级别,混合不同文章、交叉调换段落顺序也不能改变指纹。
本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/SEO实战密码-markdown-第10章-SEO-作弊及惩罚-主要-SEO-作弊方法-采集和伪原创-613108.md(仅本地保留,不入库不部署)