知识库首页 seo-llm 资料 张亚楠 - GEO 技术端优化全流程:抓取、索引与引用的实战指南.pdf.txt

张亚楠 GEO 技术端优化全流程:抓取、索引与引用的实战指南.pdf

本地来源:seo-llm/raw/seo知识库/TXT整理/PPT/14位演讲嘉宾PPT汇总/张亚楠 - GEO 技术端优化全流程:抓取、索引与引用的实战指南.pdf.txt

GEO 技术端优化全流程:抓取、索引与引用的实战指南

案例 + 工具 + 检查清单

SEO技术流 / 张亚楠

张亚楠
一)前阿里SEO项目负责人
负责过 Alibaba 国际站、AliExpress 速卖通

二)《SEO技术流》公众号博主
分享 SEO/GEO 的方法、认知、工具和案例等

三)也许是最会跑步的营销人?
参加多场马拉松,下场香港马拉松

content
目录

01

背景

02

GEO 的核心环节

03

抓取的优化

04

索引的优化

05

曝光/引用的优化

06

一些建议

背景

流量规模对比

对SEO造成的零点击

90
80
70
60
50
40
30
20
10
0

ChatGPT 流量趋势

82.28

5.8444
google.com

出现 AI 概览的 SEO

61%

点击率下降

chatgpt.com

Google 11月访问量是
chatgpt 的

14倍

引用来源:
《AIO对Google点击率的影响》(9月)https://www.seerinteractive.com/insights/aio-impact-on-google-ctr-september-2025-update
《Similarweb站点流量排名》(11月)https://pro.similarweb.com/#/digitalsuite/markets/webmarketanalysis/mapping/All/999/1m?webSource=Total
《ChatGPT 月访问量:SEO 分析与竞争对手对比》(8月)https://www.similarweb.com/blog/marketing/geo/chatgpt-monthly-visits/

ChatGPT 访问量在高速增长,
年同比增长

117%

Google & ChatGPT 流程对比

•
•
•
•

抓取量大,技术成熟
包含多语言、多媒体
能识别 JS
遵守robots.txt

•
•
•

抓取量相对小
无法抓取 JS
遵守robots.txt
抓取完全一样,
Google 更胜一筹

•
•
•

用户搜索/
提问

收录

抓取

•
•

•
•

存储原生网页和内容
数据更新及时

存储语料,用于训练
内容类型:基础常识、权
威媒体信息、UGC 信息

索引基本一样。
Google存储原生网页和内容,
ChatGPT对内容进行学习和训练

•

用具体、精准的
搜索词

•

自然语言来提问

一个搜索框,
一个对话框

AI 和 搜索引擎的核心环节是基本一致的,在每个环节有部分差异
AI 和搜索在相互学习,功能靠拢;
对 SEO 来说,只要稍微调整方向,就可以兼顾GEO和SEO

曝光/排名

•
•

展示网页链接为主
AI功能:AIO+AI mode等

•
•
•

直接展示答案,和少量链接
问题:准确度、即时性
搜索功能:Google数据做补充
Google展示原始网页链接,
ChatGPT展示分析和推理后的内容

抓取优化

核心思路:先解决“能不能抓”,再解决“抓得对不对”。

1. Robots 与服务器配置、跳转问题
我们一般会注意 Googlebot 的抓取,而忽略
AI 爬虫的正常抓取。常见的 3 种问题:
•
•
•

Robots.txt 对 AI 爬虫的屏蔽(AI爬虫有不
同的 User-Agent)
服务器端配置导致 AI 爬虫被屏蔽
多次跳转问题导致无法被抓取
• Google支持5次,AI爬虫支持最多3次

错误案例:
建议:确保 robots.txt、服务器配置正确,减少跳转。 某个网站在服务器端错误配置,屏蔽了
AI爬虫

方法:
• AI爬虫抓取验证工具( www.bestwaytool.com/aibots-checker/ ,免费)
• 查看原始服务器 log 日志

抓取优化

核心思路:先解决“能不能抓”,再解决“抓得对不对”

2. 重要内容不要用 JavaScript 渲染

建议:
•

重要内容要在 HTML 代码中,不要放
在JavaScript 渲染;

方法:
•
•

使用 SSR (服务端渲染) 或 预渲染,不使用
CSR (客户端渲染)
右键查看 HTML 源代码,进行内容检查

AI 爬虫暂时没有
JavaScript 渲染能力

Googlebot 的抓取流程
这是某网站在禁用 JS 后的网页情
况,可以理解为 AI 爬虫看到的页面

索引/理解优化

核心思路:不光是要索引,还要被理解/识别。

1. 结构化数据尤其重要

建议:
网页中尽量添加结构化数据,方便 AI
直接识别主体。
方法:
• 每个页面都可以部署结构化数据:
•
•
•
•

•
以上是Pollo AI 首页 Organization的结构化数据,
将品牌信息,以及其他社媒账号关联起来。

•

首页:Organization、WebSite
列表:BreadcrumbList、ItemList、 FAQPage
产品详情页:Product、 Offer、 AggregateRating 、
BreadcrumbList 、 FAQPage
软件产品页: SoftwareApplication、 Offer、
AggregateRating 、 FAQPage

可使用 Schema.org 支持的所有结构化数据,不光
能用 Google 支持的几种
可以使用 AI 直接生成

索引/理解优化

核心思路:不光是要索引,还要被理解/识别。

2. 多平台/多媒体/多语言的发布
ChatGPT 的信息来源主要有4
类:

建议:
•

Wikipedia

7.80%

Reddit

1.80%

• 权威信息 - Forbes 等著名媒体

G2

1.10%

• UGC 信息 - Reddit、G2 等 UGC
平台

Forbes

1.10%

TechRadar

0.90%

BusinessInsider

0.80%

NerdWallet

0.80%

Toxigon

0.70%

NYPost

0.70%

Reuters

0.60%

• 基础信息 - wikipedia

• 实时信息 - 从 Google 的搜索
结果获取

另外,Google AI 还有较大
比例的 YouTube 引用。

0.00%
5.00%
ChatGPT 的引用网站比例

•

除了官网自身,还要覆盖多个平台、多种内
容类型。
一个好品牌不会只在一个平台被提及。

侧面案例:

10.00%

某个朋友的Reddit 营销,24年获得每天1K引荐流量

曝光+引用优化

目标:品牌曝光、网站引用。

多个建议:
•

传统 SEO 很关键:
•

SEO 表现越好,被 AI 引用概率越高

•

高权重网站在 AI 中同样受青睐

•

好的 SEO 也是好的 GEO

•

网站速度影响 AI 引用

•

使用自然语言 URL(5-7 个单词)可使 AI 引
用量增加 11.4%。

•

清晰的 HTML 结构,比 llms.txt 、markdown
更重要

•

EEAT 是内容的原则

•

内容要面向话题与需求,如问答格式的内
容

ChatGPT的引用因素
外链域名量

网站总流量
INP(性能指标)
页面信任度
域名信任度

首页的全球流量
Quora 上的品牌提及次数
FCP (性能指标)
LCP(性能指标)
内容长度 (主要内容的字数)

主要内容中的问答部分
标题或 H1 中采用问句格式
Reddit 上的品牌提及次数
速度指数
章节之间的字数
在评论平台上的存在感
URL 在自然搜索中的平均排名
受信任的域名后缀 (如 .gov, .edu)
URL 的语义相关性
0

0.2 0.4 0.6 0.8

1

1.2 1.4

引用来源:https://seranking.com/blog/how-to-optimize-for-chatgpt/

整体建议
建议的:

不建议的:

•

关注变化与趋势: 保持敏锐

•

只关注 SEO 忽略 GEO,或者相反

•

保持 SEO 和 GEO 的平衡

•

•

关注品牌与营销: 品牌即实体,实体即信任

只关注传播,不关注品牌与信任(低质量传播
在 GEO 时代会被过滤)

•

关注信任建立: E-E-A-T 在 AI 眼里就是权重

•

•

白帽 GEO:利用 AI 来提升效率

过度依赖“提示词注入”(Prompt Injection),
容易被视为 Spam

•

黑帽 GEO:利用 AI 批量产生无价值的内容

免费检查清单
我们整理了一份详细的技术性 GEO 自查表,涵盖从代码层到内容层的 10+ 项检查点。
请扫描免费使用。

THANKS



本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/raw-seo知识库-TXT整理-PPT-14位演讲嘉宾PPT汇总-张亚楠-GEO-技术端优化全流程-抓取-索引与引用的-c25ba5.txt(仅本地保留,不入库不部署)