如何读取网络日志的方法

开发者福利!热门AI工具限时免费用 购周边即赠Coding Plan Lite,Claude Code、Cursor等20+工具畅享,效率翻倍! 阅读详情
所谓的网络日志就是搜索引擎爬虫爬取网站页面的一种记录,通过查看网络日志我们可以分析蜘蛛爬行有无异常,从而得知网站是否产生对搜索引擎的不友好度。此外还可以查看网友的访问记录。网络日志对网站的安全也起着监管左右,如果某个IP访问量过大,就有可能是想侵入后台系统或者其他危害网站安全的行为。
 
网络日志是一种存文本形式,在空间商提供的后台就可以下载,一般的命名是ex某年某月某日.log。通过记事本我们就能打开它。那么究竟该如何读取呢?这才是 ZAC今天想要告诉大家的。
 
就从嘉兴SEO的博客说起。我们先在日志里复制一段出来:
2011-10-19 23:46:34 W3SVC103 175.41.23.4 GET /ZAC/54.html - 80 - 123.125.71.33 Baiduspider+(+http://www.baidu.com/search/spider.htm) 200  1236 0 292
 
第一段表示的自然是时间.
W3SVC103表示万维网不用去管它。
175.41.23.4网站服务器的IP地址
GET:指服务器所作的动作,get的意思是获取
/ZAC/.54html:我博客中的文件
80:东八区
Baiduspider+(+http://www.baidu.com/search/spider.htm) :百度蜘蛛。关于其他爬虫的名字我在之前 如何写robots的博文里说到过。
 
其他蜘蛛的类型表现形式为:
Baiduspider+(+http://www.baidu.com/search/spider.htm) 百度蜘蛛
Mozilla/5.0 (compatible; Yahoo! Slurp China; http://misc.yahoo.com.cn/help.html) 雅虎中国蜘蛛
Mozilla/5.0 (compatible; Yahoo! Slurp/3.0; http://help.yahoo.com/help/us/ysearch/slurp) 英文雅虎蜘蛛
Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) Google蜘蛛
 msnbot/1.1 (+http://search.msn.com/msnbot.htm) 微软 Bing蜘蛛
 Sogou+web+robot+(+http://www.sogou.com/docs/help/webmasters.htm#07)搜狗蜘蛛
 Sosospider+(+http://help.soso.com/webspider.htm) 搜搜蜘蛛
Mozilla/5.0 (compatible; YodaoBot/1.0; http://www.yodao.com/help/webmaster/spider/; ) 有道蜘蛛
 
200:指百度蜘蛛成功获取了此文件。这这里要着重说明下:
200:成功抓取了文件
301:永远转向
302:暂时转向
304:未抓取
400:非法请求
401:无法访问
403:禁止访问
500:服务器内部错误
503:服务器没有应答
 
1236 0 292:这里指的是文件的大小,单位是字节。
 
这里分析的是百度蜘蛛的爬取,其他搜索引擎跟蜘蛛大体一致。
 
除了爬去页面之外(上面介绍的是zac/54html这个页面)蜘蛛还会爬行网站系统的文件。比如:
2011-10-19 00:35:23 W3SVC103 175.41.23.4 GET /themes/j-spring/style/j-spring/nav_bg1.gif-80-115.229.31.105 Mozilla/5.0+(Windows;+U;+Windows+NT+5.1;+en-US)+AppleWebKit/534.16+(KHTML,+like+Gecko)+Chrome/10.0.648.205+Safari/534.16 200 0 0 439 453
 
/themes/j-spring/style/j-spring/nav_bg1.gif:指的是文件,这里是一个gif的图片
Mozilla/5.0+(Windows;+U;+Windows+NT+5.1;+en-US):用户电脑配置。蜘蛛爬行其实是模拟用户访问的方式来爬行的。这里表示的意思是:
Mozilla/5.0+:与Ntescape兼容的Mozilla浏览器
Windows;+U:在美国的Windows系统
Windows+NT+5.1操作系统,这里是Windows XP,因为XP的内核是NT5.1
en-US:语言是美国英语
AppleWebKit:苹果浏览器
KHTML,+like+Gecko:一种代码,我也不太懂,这里不做介绍
Chrome:谷歌浏览器
Safari:Safari浏览器
 
这里搜索引擎会以各种浏览器的身份去访问网站的文件,这里一共用到了苹果浏览器,谷歌浏览器和Safari浏览器。
 
当然蜘蛛还会以其他浏览器的身份访问,比如说火狐,IE,360,等等。

本文系嘉兴SEO原创文章,原文地址:http://www.zbseoer.com/ZAC/log.html
网络日志数据session案例(上) 转载自www.51doit.com培训班的课程案例 194.237.142.21 - - [18/Sep/2013:06:49:18 +0000] "GET /wp-content/uploads/2013/07/rstudio-git3.png HTTP/1.1" 304 0 "-" "Mozilla/4.0 (compatible;)" 183.49.46.228 - - [18/S... 阅读详情

相关推荐

自动化网络日志分析:让数据说话,提升系统安全与性能

自动化网络日志分析是一项能够极大提高工作效率的技术。通过Python,我们可以轻松地从海量日志数据中提取出有用的信息,进行深度分析、异常检测和趋势可视化,从而帮助我们更好地管理系统和应对潜在的安全威胁。

Echo_Wish 282

web页面读取后台日志

页面读取linux日志,相当于tail -f 日志文件,可以查看日志

23、网络日志知识发现与可信计算技术解析

本文详细解析了网络日志中的知识发现方法及其在网络安全中的应用,同时全面介绍了可信计算技术的核心概念、主要技术(如TPM、英特尔TXT、AMD/ARM Trustzone、SGX等)、应用场景以及面临的挑战。文章还探讨了可信计算的发展趋势,包括多种技术的融合、生物识别技术的应用以及应对新型攻击的创新机制。通过实际案例分析,展示了可信计算在金融、医疗等领域的应用价值,并对未来可信计算技术的发展进行了展望。

tree8的博客 84

python爬虫之Scrapy框架--日志信息--数据提取

本篇文章详细介绍了在Scrapy框架中的控制台日志信息的了解和数据提取与处理方法,包括选择器的使用、Item的定义与使用以及数据处理与管道的应用。

m0_67093160的博客 2063

搜索引擎爬虫

搜索引擎爬虫(优质引流???) 最近发现服务器日志上多了一些奇怪的日志 {"remote_addr":"203.208.60.66","remote_user":"","time_local":"25/Oct/2021:14:34:27 +0800","request":"POST /api/v9494/service-global/anonymity/search/aggsSearch HTTP/1.1","status":"403","body_bytes_sent":"196","referer":"

lovepiggirl的博客 4227

Python 爬取各搜索引擎提示词

我们学习Python必然是为了找到高薪的工作,下面这些面试题是来自阿里、腾讯、字节等一线互联大厂最新的面试资料,并且有阿里大佬给出了权威的解答,刷完这一套面试资料相信大家都能找到满意的工作。Python所有方向的技术点做的整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。观看零基础学习视频,看视频学习是最快捷也是最有效果的方式,跟着视频中老师的思路,从基础到深入,还是很容易入门的。最后祝大家天天进步!

Trb401012的博客 547

HTML日志抓取,如何通过日志查看百度蜘蛛抓取情况

我们做SEO都知道,百度用于抓取页的程序叫做Baiduspider - 百度蜘蛛,我们查看站被百度抓取的情况主要是分析,日志里百度蜘蛛Baiduspider的活跃性:抓取频率,返回的HTTP状态码。我们该如何查看百度蜘蛛的抓取情况呢?那就要查看服务器日志,查看日志的方式:通过FTP,在站根目录找到一个日志文件,文件名一般包含log,下载解压里面的记事本,这即是站的日志,记录了站被访问...

weixin_39761255的博客 1159

浅谈搜索引擎日志分析(SEO)

对于站优化来说,搜索引擎日志分析是必不可少的一块,无论你是收录上百的小型站,还是收录上百万的大中型站,SEO要想做得好,都必需进行科学的日志分析,日志是发生在服务器上的所有事件的记录,包括用户访问记录,搜索引擎抓取记录,对于一些大型站来说,每天的日志都有好几个G大小的,我们可以使用linux命令去进行分离的,在大型日志文件往往是机密文件,一般人是看不到的,因为从日志里边可以分析...

iteye_2022的博客 673

Storm 实时读取本地文件操作(模拟分析网络日志

WebLogProduct 产生日志类 package top.wintp.weblog; import java....

weixin_30487317的博客 214

python以空格分割,忽略引号内的空格

python 交流学习群205075113 文件内容(a.txt):111.44.253.143 - - [21/Mar/2018:06:35:43 +0800] "GET http://aod.tx.xmcdn.com/group28/ ... pAKbHCJCCS3s167.m4a HTTP/1.1" 206 33268 "-" "ting_6.3.81(MX5,Android22)" TC...

4008

C中的正则函数sscanf

头文件 #include 定义函数 int sscanf (const char *str,const char * format,........); 函数说明 sscanf()会将参数str的字符串根据参数format字符串来转换并格式化数据。格式转换形式请参考scanf()。转换后的结果存于...

ddz777751的博客 123

Linux网络日志怎么查看?

var/log/nginx/access.log 或 /var/log/apache2/access.log:Web服务器访问日志,反映HTTP请求情况。less /var/log/nginx/access.log:浏览Web访问日志,分析客户端IP、请求路径、状态码等。/var/log/firewalld 或 /var/log/iptables.log:防火墙规则触发的日志。/var/log/syslog:Ubuntu/Debian系统的全局日志,记录所有系统事件,包括网络活动。使用命令查看网络日志

oldboyedu1的博客 357

java实现对纯真IP数据库的查询

来源:http://www.blogjava.net/lcs868/archive/2008/12/16/246644.html 用java实现对纯真IP数据库的查询,首先到上下载QQwry.da文件,读取代码如下: 1.IP记录实体类 package com.guess.tools;  

547

WinZlog - 一个强大的Windows上的开源网络日志分析工具

WinZlog - 一个强大的Windows上的开源网络日志分析工具 去发现同类优质开源项目:https://gitcode.com/ WinZlog是一个基于C++编写的开源网络日志分析工具,可以在Windows平台上运行。它旨在帮助网络管理员快速、准确地分析各种网络日志文件,以便更好地理解网络流量和性能。 应用场景 以下是几个你可以使用WinZlog的常见应用场景: 网络监控:通过分析网络日...

gitblog_00058的博客 1422

python获取浏览器network_如何使用python硒获取浏览器网络日志

I'm trying to get browser network logs using selenium to debug request/responses. Could you please help me to find out a way.And I'm using selenium 3.14.0 and latest Chrome browser.解决方案Using Python an...

weixin_39600823的博客 749

spark 处理网络日志 查询pv uv实例

这里我们先理解一下spark处理数据的流程,由于spark 有standalone,local,yarn等多种模式,每种模式都有不同之处,但是总体流程都是一样的,大致就是客户端向集群管理者提交作业,生成有向无环图,图中的内容包括分成几个stage,每个stage有几个task,每个task分别由哪个executor来执行,接下来的工作就是整个spark集群按照有向无环图的布置来进行,并得出结果。下...

weixin_41407399的博客 1247

Snoopy - 一个灵活的网络日志分析工具

Snoopy - 一个灵活的网络日志分析工具 项目简介 Snoopy 是一个由 开发的网络日志分析工具。它旨在为开发人员提供一种简单、灵活的方式来解析和分析他们的应用程序或服务器生成的日志文件。与许多传统的日志分析工具不同,Snoopy 使用 Python 编写,并且易于扩展以支持自定义日志格式。 应用场景 Snoopy 可用于多种场景,包括但不限于: 监控应用程序性能:通过实时分析应用程序产...

gitblog_00010的博客 513
上一篇: 怎样做好网站外链
下一篇: 对年轻离职者的忠告
cryingknife
博客等级 码龄16年 14粉丝 5原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值