[转]使用Snoopy采集时被封ip怎么办,试试这个解决方法

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情

最近各种网站的采集程序写的比较多,遇到在采某网站时采到100多条时突然发现对方的网站打不开了,猜到肯定被封ip了,用了代理还是会封,这不是办法。在网上找了一些资料都没有找到,功夫不负有心人啊,在找的时侯有一个人提到了用搜索引擎爬虫蜘蛛的USERAGENT。虽然只提到一点点我还是想到了,列出我的解决方法,

1.使用Snoopy或curl传搜索引擎爬虫的USERAGENT值。
查看搜索引擎爬虫的USERAGENT值:

搜索引擎爬虫蜘蛛的USERAGENT收集
百度爬虫
    * Baiduspider+(+http://www.baidu.com/search/spider.htm”)

google爬虫
    * Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
    * Googlebot/2.1 (+http://www.googlebot.com/bot.html)
    * Googlebot/2.1 (+http://www.google.com/bot.html)

雅虎爬虫(分别是雅虎中国和美国总部的爬虫)
    *Mozilla/5.0 (compatible; Yahoo! Slurp China; http://misc.yahoo.com.cn/help.html”)
    *Mozilla/5.0 (compatible; Yahoo! Slurp; http://help.yahoo.com/help/us/ysearch/slurp”)

新浪爱问爬虫
    *iaskspider/2.0(+http://iask.com/help/help_index.html”)
    *Mozilla/5.0 (compatible; iaskspider/1.0; MSIE 6.0)

搜狗爬虫
    *Sogou web spider/3.0(+http://www.sogou.com/docs/help/webmasters.htm#07″)
    *Sogou Push Spider/3.0(+http://www.sogou.com/docs/help/webmasters.htm#07″)

网易爬虫
    *Mozilla/5.0 (compatible; YodaoBot/1.0; http://www.yodao.com/help/webmaster/spider/”; )

MSN爬虫
    *msnbot/1.0 (+http://search.msn.com/msnbot.htm”)

2.使用Snoopy或curl传referer值。
   如:$snoopy->referer = 'http://www.google.com';
         $header[] = "Referer: http://www.google.com/";

3.使用Snoopy或curl代理。
   如:$snoopy->proxy_host = "59.108.44.41";
         $snoopy->proxy_port = "3128";

4.使用Snoopy或curl防造IP。
   如:$snoopy->rawheaders['X_FORWARDED_FOR'] = '127.0.0.1';


本文转载自<这一技客> http://www.geekso.com

别再手动模拟了!用Chrome开发者工具5分钟搞定Googlebot视角,检查你的网站SEO 本文详细介绍了如何使用Chrome开发者工具快速模拟Googlebot视角,检查网站SEO问题。通过配置User agent和网络条件,开发者可以识别渲染差异、验证结构化数据、排查资源加载问题,从而优化搜索引擎可见性。文章还提供了主流爬虫UA及适用场景,帮助您全面诊断SEO表现。 阅读详情

相关推荐

php采集ip解决方法

在网上找了一些资料都没有找到,功夫不负有心人啊,在找的侯有一个人提到了用搜索引擎爬虫蜘蛛的USERAGENT。虽然只提到一点点我还是想到了,列出我的解决方法, 1.使用Snoopy或curl传搜索引擎爬虫的USERAGENT值。 查看搜索引擎爬虫的USERAGENT值:https://www.jb51.net/yunying/29357.html 2.使用Snoopy或curl传referer值。 如:$snoopy->referer = ‘http://www.google.com’; $header[] = “Referer: http://www.google.com/”; 3.使用S

爬虫系列——做爬虫必备:各大网站蜘蛛UA

前言 User Agent中文名为用户代理,简称 UA,它是一个特殊字符串头,使得服务器能够识别客户使用的操作系统及版本、CPU 类型、浏览器及版本、浏览器渲染引擎、浏览器语言、浏览器插件等。 了解各大搜索引擎蜘蛛爬虫的UA,对我们进行某些程序编写十分有用,例如网页判断客户端来源,UA是常用的标准之一。本文收集了各大搜索引擎的蜘蛛爬虫UA,以便需要查阅。 1.百度蜘蛛Baiduspide......

前方一片光明 1万+

Java –检查网络请求是否来自Google搜寻器

如果网络请求来自Google搜寻器或Google漫游器,则请求的“用户代理”应类似于以下内容: Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) or (rarely used): Googlebot/2.1 (+http://www.google.com/bot.html) 资料来源...

一名可爱的技术搬运工 619

常见User Agent

常见User Agent 0x00 前言 某项目重保候,看设备发现不少爬虫的包以及那种扫描器修改UA伪装成搜索引擎爬虫试图绕过设备堵的攻击,所以记录下来,以后好记住 0x01 搜索引擎的UA 谷歌User-Agent: 谷歌 PC UA Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) 谷歌移动UA AdsBot-Google-Mobile (+http://www.google.com/mobile

qq_22807425的博客 1659

搜索引擎访问模拟(百度、谷歌、雅虎…)

WebRequest.UserAgent = "Googlebot/2.1 (+http://www.google.com/bot.html)"; Mozilla/5.0+(compatible;+Baiduspider/2.0;++http://www.baidu.com/search/spider.html) Mozilla/5.0 (compatible; Googlebot/2.1;...

weixin_30314793的博客 496

对官网文档做SEO

思路将我们现有文档给搜索引擎

1503

使用Snoopy采集ip怎么办,试试这个解决方法

最近各种网站的采集程序写的比较多,遇到在采某网站采到100多条突然发现对方的网站打不开了,猜到肯定被ip了,用了代理还是会,这不是办法。在网上找了一些资料都没有找到,功夫不负有心人啊,在找的侯有一个人提到了用搜索引擎爬虫蜘蛛的USERAGENT。虽然只提到一点点我还是想到了,列出我的解决方法, 1.使用Snoopy或curl传搜索引擎爬虫的USERAGENT值。 查看搜索引擎爬虫的U

qw_xingzhe的专栏 787

PHP使用Snoopy类抓取页面以及使用方式

Snoopy类是一个非常好用的网络访问类,它可以模拟浏览器的HTTP请求,做你想做的事情。现在让我们看一个简单的例子: 12345678910<?php$url='http://hi.baidu.com/phphack';include'snoopy.php';$snoopy=new Snoopy();$snoopy->fetch($url);//获取所有内容echo$snoopy-...

weixin_34250434的博客 123

htb snoopy wp记录

htb snoopy wp

mikumiku~ 1410

搜狗爬虫(www.sogou.com)IP及UA,真实采集数据

3、判断标准:主要根据用户代理是否包含“zhanzhang.toutiao.com”和IP核实。对网站没什么危害,抓取网站频繁,对资源消耗较大,可为网站带来的客户量次于百度和360.1、这批搜狗爬虫(www.sogou.com)IP来源于尚贤达。二、搜狗爬虫(www.sogou.com)主要有4个用户代理。2、数据采集间段:2023年10月-2024年7月;

尚贤达谭工的博客 3386

浏览网页访客和搜索引擎爬虫不同的Agent 内容

一般来说, 网站的首页是搜索引擎访问最多的页面, 应该尽可能的向它们展示有意义的内容, 但是要以列表的形式显示文章的话, 访客和搜索引擎只能获取到文章标题信息. 文章内容或者摘要 (尤其是文章的第一句) 对于 SEO 来说是极其重要的, 所以我们要设法向爬虫发送这些内容.好, 我

风信子的专栏 1696

Googlebots(Google爬虫)一览

Google一共有多少种Googlebot呢?因为Google需要派出不同的类型的Googlebot来分析及抓取不同的网页内容。SERT的Phoenix整理出了一个列表,如下:  1.Googlebot(即普通抓取网页的Google爬虫,例如"Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" )  2

baggio785的专栏 3446

搜索引擎爬虫蜘蛛的UserAgent收集

百度爬虫 * Baiduspider+(+http://www.baidu.com/search/spider.htm”) google爬虫 * Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) * Googlebot/2.1 (+http://www.googleb

rztyfx的专栏 2315

搜索引擎机器人(robot)名称大全

<br />谷歌googleGooglebot<br />http://www.google.com/bot.html<br /> <br /> <br />百度baidu:Baiduspider <br />http://www.baidu.com/search/spider.htm<br /> <br />雅虎yahoo!:Yahoo!+Slurp <br />http://misc.yahoo.com.cn/help.html<br /> <br />MSN:msnbot<br />http://s

虎нǔ孓 3232

各大搜索引擎爬虫UA

百度User-Agent: 来源:http://zhanzhang.baidu.com/college/articleinfo?id=1002 http://zhanzhang.baidu.com/college/courseinfo?id=150 移动UA : Mozilla/5.0 (Linux;u;Android 4.2.2;zh-cn;) AppleWebKit/534.46 (KHTML...

诗与浪子的博客 5760

搜索引擎爬虫蜘蛛的USERAGENT收集(

1.使用Snoopy或curl传搜索引擎爬虫的USERAGENT值。 查看搜索引擎爬虫的USERAGENT值: 搜索引擎爬虫蜘蛛的USERAGENT收集 百度爬虫 * Baiduspider+(+http://www.baidu.com/search/spider.htm”) google爬虫 * Mozilla/5.0 (compatible...

weixin_34129145的博客 197

搜索引擎对应的User-Agent

做优化的过程中经常说到一个名词“蜘蛛”,这里所说的蜘蛛是搜索引擎爬虫或机器人的一种俗称,它是搜索引擎的一种全自动的程序,其作用是自动搜索和访问互联网上的网站,并抓取其中的内容来建立相关的索引数据库,使用户在使用搜索引擎的过程中迅速通过索引页进入相关的网站,通常在网站的日志里面我们可以看到它的踪影。下面介绍一下几大搜索引擎对应的User-Agent: baidu:Mozilla/5.0 (co

rztyfx的专栏 1380
上一篇: [转]日均百万PV网站解决方案
weq221
博客等级 码龄24年 11粉丝 32原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值