Googlebots(Google爬虫)一览

开发者福利!热门AI工具限时免费用 购周边即赠Coding Plan Lite,Claude Code、Cursor等20+工具畅享,效率翻倍! 阅读详情
Google一共有多少种Googlebot呢?因为Google需要派出不同的类型的Googlebot来分析及抓取不同的网页内容。SERT的 Phoenix整理出了一个列表,如下:

  1.Googlebot(即普通抓取网页的Google爬虫,例如 "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"

  2.MediaBot(用来分析投放了AdSense广告的网页。User Agent:"Mediapartners-Google")

  3.ImageBot(用来分析图片,然后将结果提交到Google图片搜索。User Agent:"GoogleBot-Image")

  4.AdsBot(用来检查AdWords的广告着陆页的质量。User Agent:"AdsBot-Google")

  5.Feedfetcher-Google(用来抓取各种RSS Feed)

  6.Generic Mobile Phone(移动版的Googlebot) (compatible;GooglebotMobile/2.1;+http://www.google.com/bot.html)

  上面的列表不一定完整,因为应该还有一些没有被发现的,感兴趣的朋友请留意WMW上面的 相关讨论

  其实这些bots才是真正的辛勤劳动者,日夜不停地来回奔跑,值得尊敬。当然,前提是它们对你家网站感兴趣。
伪装成Google Bot突破收费网站页面 为什么有的网站能够被Google搜索到,点击链接进去以后却显示“未注册”、“还不是会员”呢?这是一种网站专门针对对搜索引擎优化的技术。 那么我们也可以伪装成搜索引擎来进入这些页面。我们需要的是修改浏览器的User-Agent值。下面以Internet Explorer为例说明: 把下列代码保存为 ua.reg,双击导入到注册表中: 以下是引用片段:Windows Registry Editor ... 阅读详情

相关推荐

Java –检查网络请求是否来自Google搜寻器

如果网络请求来自Google搜寻器或Google漫游器,则请求的“用户代理”应类似于以下内容: Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) or (rarely used): Googlebot/2.1 (+http://www.google.com/bot.html) 资料来源...

一名可爱的技术搬运工 619

整理的爬虫IP及其用户代理

IP地址 用户代理+MSIE+5.01;+MSIE+5.01;+Win32;?

尚贤达谭工的博客 6559

搜索引擎爬虫蜘蛛的USERAGENT大全

百度爬虫 * Baiduspider+(+http://www.baidu.com/search/spider.htm”) google爬虫 * Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) * Googlebot/2.1 (+http://www.googlebot.com/bot.h...

持续疯长,往天那边去 311

Google爬虫家族[Spider]

原文:http://hi.baidu.com/shichunqi/blog/item/65a8881334d81f04c83d6d42.html Google爬虫是连接互联网和你的查询需求之间的第一座桥梁。 是新站长们所最喜闻乐见的东东之一。 “她的美并不艳丽,甚至很内敛,却能给人一种安定的感觉。”也许新站长们会用此来形容Google爬虫GoogleBot: 是Goog...

alna13051的博客 429

信息收集WEB安全入门

在渗透测试时,信息收集的全面性对于后期的渗透工作必为重要,甚至关联到能不能挖掘到漏洞,本篇文章从基本的信息收集方法进行详解,从根本上解决初、中级渗透测试人员不会收集网站信息的问题。   内容大纲: 一、基本信息收集 三、搜索引擎利用 二、网站后台查找     一、基本信息收集   1.0、域名信息 1.1-Whois查询 根据已知域名反查,分析出此域名的注册人、邮箱、电...

qq_37870222的博客 4828

搜索引擎机器人(robot)名称大全

<br />谷歌googleGooglebot<br />http://www.google.com/bot.html<br /> <br /> <br />百度baidu:Baiduspider <br />http://www.baidu.com/search/spider.htm<br /> <br />雅虎yahoo!:Yahoo!+Slurp <br />http://misc.yahoo.com.cn/help.html<br /> <br />MSN:msnbot<br />http://s

虎нǔ孓 3232

伪装成Google Bot突破收费页面

为什么有的网站能够被Google搜索到,点击链接进去以后却显示“未注册”、“还不是会员”呢?这是一种网站专门针对对搜索引擎优化的技术。 那么我们也可以伪装成搜索引擎来进入这些页面。我们需要的是修改浏览器的User-Agent值。下面以Internet Explorer为例说明: 把下列代码保存为 ua.reg,双击导入到注册表中: Windows Registry Edit...

380

屏蔽国外垃圾无用蜘蛛,防止大量抓取导致网站崩溃浪费带宽

Sogou web spider是搜狗搜索的网页爬虫,其UA标识为“Sogou web spider/4.0(+http://www.sogou.com/docs/help/webmasters.htm#07)”。从名字上看,神马搜索的发音类似于宜搜,但和专注小说搜索的“宜搜(http://easou.com/)”不是同一家公司。主要是将从网站日志中发现的一些异常抓取的蜘蛛屏蔽掉,我上面列举的是一些常见的对我们网站没啥用处的蜘蛛,将这些蜘蛛屏蔽掉就好了。

come521的专栏 5470

揭秘!GoAccess日志神器精准揪出网络爬虫,一键拉黑用户代理,让我看看谁家爬虫这么明目张胆?

最近服务器安装了GoAccess分析日志,每天都有新发现,看到Crawler占比有点大,还是要搞清楚哪些是非法爬虫,那些是可以接受的爬虫.操作系统操作系统排序按 [点击量, 平均响应时, 总共响应时, 最高响应时]浏览器浏览器排序按 [点击量, 平均响应时, 总共响应时, 最高响应时]通过上述面板均可发现有不少Crawler爬虫类,点开还能看到具体的明细,这样就好办了.看谁不爽拉黑谁!本文主要介绍了如果利用GoAccess分析出异常浏览器,识别出爬虫分类,基于互联网公开资料有选择性拉黑某些恶意爬虫.

雪之梦技术驿站 2354

爬虫系列——做爬虫必备:各大网站蜘蛛UA

前言 User Agent中文名为用户代理,简称 UA,它是一个特殊字符串头,使得服务器能够识别客户使用的操作系统及版本、CPU 类型、浏览器及版本、浏览器渲染引擎、浏览器语言、浏览器插件等。 了解各大搜索引擎蜘蛛爬虫的UA,对我们进行某些程序编写十分有用,例如网页判断客户端来源时,UA是常用的标准之一。本文收集了各大搜索引擎的蜘蛛爬虫UA,以便需要时查阅。 1.百度蜘蛛Baiduspide......

前方一片光明 1万+

网络爬虫

1.什么是网络爬虫 网络爬虫是按照一定规则自动的抓取万维网信息的程序或脚本。通俗理解的话网络爬虫是一个模拟人类请求网站行为的程序。可以自动请求网页、抓取特定数据,然后使用一定规则提取有价值的数据。 网络爬虫按照功能来分类的话主要分为四类:通用网络爬虫、聚焦网络爬虫、增量式网络爬虫、深层网络爬虫。 通用网络爬虫 通用爬虫又称全网爬虫,爬行对象从一些种子 URL 扩充到整个 Web,通用爬虫是搜索引擎...

Dulpee的博客 3599

Google爬虫Google机器人、Google蜘蛛、Google Spider

      我们知道,搜索引擎数据库中的所有网页,都是由Robot程序自动抓取收录的。不过,对于这些所谓的Spider或Robot究竟以怎样的机制在网站内爬行、收录网页则可能很多人就不太清楚了。自本文开始,我们将逐步介绍这方面的一些情况。  本文我们将首先介绍Google的Robot,包括Google最重要的几种Robot类型、相应的功能以及如何控制它们以保证网站优化效果。  只要打开您的

jansonleader的专栏 3223

Google蜘蛛UA及IP

Google# UA “AdsBot-Google (+http://www.google.com/adsbot.html)”# UA “Googlebot-Image/1.0″# UA “Googlebot/2.1 (+http://www.googlebot.com/bot.html)”# UA “Googlebot/Test (+http://www.googlebot.com/bot....

soledede 571

常见User Agent

常见User Agent 0x00 前言 某项目重保时候,看设备发现不少爬虫的包以及那种扫描器修改UA伪装成搜索引擎爬虫试图绕过设备封堵的攻击,所以记录下来,以后好记住 0x01 搜索引擎的UA 谷歌User-Agent: 谷歌 PC UA Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) 谷歌移动UA AdsBot-Google-Mobile (+http://www.google.com/mobile

qq_22807425的博客 1659

在线靶场-墨者-电子数据取证1星-日志文件分析溯源(Google蜘蛛)

打开靶场,下载日志文件。 打开日志文件,寻找Google蜘蛛的IP地址。 google蜘蛛的ua一般是以下几种 #UA “AdsBot-Google (+http://www.google.com/adsbot.html)” #UA “Googlebot-Image/1.0” #UA “Googlebot/2.1 (+http://www.googlebot.com/bot.html)” #UA ...

weixin_42079912的博客 548

HTTP请求中User-Agent的详细解读

用户代理(User-Agent)字符串是一种在HTTP协议中用来识别发起请求的客户端信息的机制。这个字符串通常包含了关于客户端软件的类型、版本、所用操作系统和/或其他环境信息。它在Web服务器的日志中可见,也可以在浏览器的请求头中找到。

Yuppie001的博客 9017

最新最准确各大搜索引擎蜘蛛名称2014-4-15 10:02:52

最新最准确各大搜索引擎蜘蛛名称2014-4-15 10:02:52 1、百度蜘蛛:Baiduspider网上的资料百度蜘蛛名称有BaiduSpider、baiduspider等,都洗洗睡吧,那是旧黄历了。百度蜘蛛最新名称为Baiduspider。日志中还发现了Baiduspider-image这个百度旗下蜘蛛,查了下资料(其实直接看名字就可以了……),是抓取图片的蜘蛛。常见百度旗下同类型蜘蛛还有...

weixin_30773135的博客 765

[转]使用Snoopy采集时被封ip怎么办,试试这个解决方法

最近各种网站的采集程序写的比较多,遇到在采某网站时采到100多条时突然发现对方的网站打不开了,猜到肯定被封ip了,用了代理还是会封,这不是办法。在网上找了一些资料都没有找到,功夫不负有心人啊,在找的时侯有一个人提到了用搜索引擎爬虫蜘蛛的USERAGENT。虽然只提到一点点我还是想到了,列出我的解决方法, 1.使用Snoopy或curl传搜索引擎爬虫USERAGENT值。 查看搜索引擎爬虫的U

wolf的技术博客 3059

如何让Google不收录我的网页(Robots)

如何让Google不收录我的网页(Robots)原文地址:http://www.addodo.com/bizforum/read-htm-tid-48.html通过下列网址可以让Google从此不再搜索网站,并删除你的网页:http://www.google.com/remove.html详细的说明可以查看这里: http://www.google.com/intl/zh-

mysun的专栏 1876
上一篇: Google打不开的解决方法和部分Google镜像IP地址表
下一篇: java.util.Arrays的BUG - 二分搜索算法
baggio785
博客等级 码龄25年 98粉丝 409原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值