怎样读日志文件
本地来源:seo-llm/SEO实战密码-markdown/第08章 SEO 效果监测及策略修改/流量数据监测/怎样读日志文件.md
怎样读日志文件
网站服务器会把每个访问信息、每个服务器动作、每个文件调用自动记录下来,存在服务器原始日志文件中。所以,日志中的信息是最准确、最全面的。有些 SEO 需要知道的信息在流量分析软件中很少支持,必须直接查看日志,如服务器返回的状态码,蜘蛛爬行记录等。
原始日志就是一个纯文本文件,用文字编辑软件如 WordPad 或Notepad 就可以打开。一般主机商会在控制面板提供日志文件下载。
下面是从我的博客“SEO 每天一贴”(seozac.com)2020 年 12 月的日志文件中随机选取的一行,我们来看一下它包括哪些信息:
用户 IP 地址:
访问用户所在的 IP 地址,可以显示出访问用户的地理位置。在 IP 地址信息服务查一下这个 IP 所属位置,可以看到这位访客来自南昌(如图 8-6 所示)。

图 8-6 IP 地址显示用户地理位置
日期/时间:
这是文件被访问的准确时间。和 IP 地址结合起来,查看多条日志记录就可以跟踪某一个特定的用户从一个网页到另一个网页的访问轨迹和在网站上的活动。
时区:
相对格林威治时间的时区,中国、新加坡处于东 8 区。服务器动作:
服务器要做的动作要么是 GET,要么是 POST。除了一些脚本,通常都应该是 GET,也就是从服务器上获取某个文件,可以是 HTML、图片、CSS 等。
例子里的这段记录意思就是,按 HTTP/1.1 协议获取/seo-news/dunsh-10-years/这个
URL 的文件。这里的 URL 是相对地址,已经省去了域名部分。
上面的例子是访问一个页面时的记录。在日志中,每一个图片、JS 脚本等文件的访问都会有一行记录。如:
这行日志代表获取的是 CSS 文件。服务器状态码:
服务器返回的状态码。200 指成功获取了文件,一切正常。如果返回 404,就是文件不存在/没有找到。其他常见状态码如下:
301——永久转向。
302——暂时转向。
304——文件未改变,客户端缓冲版本还可以继续使用。
400——非法请求。
401——访问被拒绝,需要用户名、密码。
403——禁止访问。
500——服务器内部错误,通常是程序有问题。
503——服务器没有应答,如负载过大等。文件大小:
指的是所获取文件的大小,例子中是 25 835 字节。来路:
显示访问者是从哪里来到当前网页,也就是来到这个网页之前访问的那个网页 URL。来路可能是同一个网站的其他页(用户通过点击网站内部链接浏览),有可能是其他网站
(用户通过其他网站上的链接点击过来),也有可能是搜索引擎的结果页面,如上面所示的例子。
以前搜索引擎来路中包含关键词信息,如下面这行典型的来路日志:
wd 参数后面就是查询词“SEO”。
现在搜索引擎出于各种原因把关键词等信息隐藏起来了,所以站长无法知道搜索流量来自什么查询词,这对 SEO 来说是一大损失。
用户代理(User Agent):
最后一段显示的是浏览器和用户计算机的一些信息。例子中这段信息表示用户使用的是:
- 与 Netscape 兼容的 Mozilla 浏览器。实际上大部分浏览器 User Agent 都使用
Mozilla/为开头,所以并不能区分浏览器。
- 浏览器是 Firefox 74.0 版本。
- Windows NT 操作系统。
如果用户使用的是其他类型的系统或浏览器,在这一段还可能看到这类代码:
- Mozilla/4.0(compatible; MSIE 6.0; Windows NT 5.0; Maxthon; Alexa Toolbar)——傲游浏览器。
- "Mozilla/5.0(Windows NT 6.1; Win64; x64)AppleWebKit/537.36(KHTML, like Gecko)Chrome/79.0.3945.130 Safari/537.36"——Chrome 浏览器。
- "Mozilla/4.0 ( compatible; MSIE 8.0; Windows NT 6.1; WOW64; Trident/4.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729; Media Center PC 6.0; .NET4.0C; .NET4.0E; 360SE)"——360 浏览器。
- "Mozilla/5.0(Windows NT 10.0; Win64; x64)AppleWebKit/537.36(KHTML, like
Gecko)Chrome/64.0.3282.140 Safari/537.36 Edge/18.17763"——微软 Edge 浏览器。搜索引擎蜘蛛就相当于一个浏览器,2.4.1 节提到的搜索引擎蜘蛛用于表明身份的用
户代理就是这段信息。如百度蜘蛛以如下信息表明自己:
日志是网站访问的最真实记录。分析用户访问时还可以借助下面介绍的 GA 等流量分析工具,但检查某些问题,如访问错误、蜘蛛爬行情况等,非依靠原始日志不可。大中型网站日志文件可能很大,人工进行完整查看是不可能的,SEO 部门可以开发专用日志分析工具,用于统计各种访问错误和蜘蛛爬行、抓取数据。
本文档为站内渲染。原始文件本地路径:saas/source/seo-llm/SEO实战密码-markdown-第08章-SEO-效果监测及策略修改-流量数据监测-怎样读日志文件-932233.md(仅本地保留,不入库不部署)