Python Scrapy之小白爬虫笔记

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情

爬虫四目标:

1、新建项目

2、明确目标

3、制作爬虫

4、存储内容

第一步:新建目标

             scrapy startproject 项目名称

             创建编写正则表达式的文件

             scrapy genspider app名称(不可与项目名称同名)

第二步:明确目标,分析网站你要抓取什么网页内容和信息

              在items.py 里面明确目标、定义抓取内容

第三步:制作爬虫  在app里面创建的文件中编写

            项目运行,进入项目目录,scrapy crawl app项目名称

settings.py 项目设置文件

# 项目设置文件,全局项目设置

# 定义抓取域
#USER_AGENT = 'douban (+http://www.yourdomain.com)'

# 并发量
#CONCURRENT_REQUESTS = 32
# 下载延迟
DOWNLOAD_DELAY = 0.5
# 域名并发量
#CONCURRENT_REQUESTS_PER_DOMAIN = 16
# IP并发量
#CONCURRENT_REQUESTS_PER_IP = 16
# 抓取登录时候使用
#COOKIES_ENABLED = False
# 使用时候开启
#DEFAULT_REQUEST_HEADERS = {
#   'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
#   'Accept-Language': 'en',
#}

# Enable or disable spider middlewares
# See https://docs.scrapy.org/en/latest/topics/spider-middleware.html
# 使用时候开启
#SPIDER_MIDDLEWARES = {
#    'douban.middlewares.DoubanSpiderMiddleware': 543,
#}
# 注册完信息在这个里面进行开启
#ITEM_PIPELINES = {
#    'douban.pipelines.DoubanPipeline': 300,
#}
items.py文件,定义抓取目标,定义数据结构,所有的item都可以定义进去

app里面定义的正则表达式文件

import scrapy

# 查重文件
class DoubanSpiderSpider(scrapy.Spider):
    # 爬虫名
    name = 'douban_spider'
    # 允许的域名
    allowed_domains = ['movie.bouban.com']
    # 引擎会要一个入口url,扔到调度器里面去,然后将请求扔到引擎里面,然后把请求扔到下载器中,下载器分析解析,然后返回给douban_spider文件
    start_urls = ['http://movie.bouban.com/top250']
    #


    # 解析数据,存储数据
    def parse(self, response):
        print(response.text)
# 第二步明确目标
# 分析抓取https://movie.douban.com/top250网站那些内容
# 第三步爬虫文件的编写
网络爬虫Python:Selenium、Scrapy框架;爬虫与反爬虫笔记 阅读详情

相关推荐

Python网络爬虫笔记11:Scrapy的使用

1安装scrapy 安装命令: pip install scrapy 安装完成后,在控制台输入命令scrapy bench;不报错则表示安装成功。 windows下安装时,可能出现以下错误: 错误1:VC++ 14.0 Twisted 解决方案:下载Twisted的whl文件,离线安装 下载网址: https://www.lfd.uci.edu/~gohlke/pythonlibs/ 下载完成后,使用如下命令安装:pip install ****.whl 错误2:运行scrap...

m1m2m3mmm的博客 357

Python笔记】网络爬虫——常用框架介绍以及 Scrapy 框架使用

网络爬虫开发常用框架Scrapy 爬虫框架Crawley 爬虫框架PySpider 爬虫框架Scrapy 爬虫框架的使用搭建 Scrapy 爬虫框架1. 安装 Twisted 模块2. 安装 Scrapy 框架3. 安装 pywin32 模块创建 Scrapy 项目 爬虫框架就是一些爬虫项目的半成品,可以将一些爬虫常用的功能写好。然后留下一些接口,在不同的爬虫项目当中,调用合适自己项目的接口,再编...

萌宅鹿的技术小屋 1986

Python网络爬虫笔记12:Scrapy进阶之数据建模与翻页

1 数据建模 通常在做项目的过程中,在items.py中进行数据建模;如果字段很少时,可以不建模 1.1为什么建模 定义item即提前规划好哪些字段需要抓,防止手误,因为定义好之后,在运行过程中,系统会自动检查 配合注释一起可以清晰的知道要抓取哪些字段,没有定义的字段不能抓取,在目标字段少的时候可以使用字典代替 使用scrapy的一些特定组件需要ltem做支持,如scrapy的ImagesPipeline管道类,百度搜索了解更多 1.2 如何建模 在items.py文件中定义要提取的字段:

m1m2m3mmm的博客 309

网络爬虫-Scrapy框架--python笔记2

一、 Scrapy命令: (一)全局命令: 格式:Scrapy 命令名 –参数 Scrapy -h 查看命令 1、fetch 命令的作用是查看爬去的过程 –nolog 命令 去除爬去日志信息 格式:Scrapy fetch 网址 --nolog 2、runspider 命令用来运行单独的爬虫文件 格式:进入爬虫文件所在目录 scrapy runsipder 爬虫文件名 3、 shell 命令用来启...

今天菜里有肉 220

Python 网络爬虫笔记9 -- Scrapy爬虫框架

Python 网络爬虫笔记9 – Scrapy爬虫框架 Python 网络爬虫系列笔记是笔者在学习嵩天老师的《Python网络爬虫与信息提取》课程及笔者实践网络爬虫笔记。 课程链接:Python网络爬虫与信息提取 参考文档: Requests 官方文档(英文) Requests 官方文档(中文) Beautiful Soup 官方文档 re 官方文档 Scrapy 官方文档(英文) Scrap...

Wang_Jiankun的博客 843

Python网络爬虫与信息提取》第四周 网络爬虫之框架 学习笔记(一)Scrapy爬虫框架

目录 一、Scrapy爬虫框架 1、Scrapy爬虫框架介绍 (1)Scrapy的定义 (2)Scrapy的安装 (3)Scrapy爬虫框架结构 2、Scrapy爬虫框架解析 (1)Scrapy爬虫框架结构 (2)五个模块 (3)两个中间键 3、requests库和Scrapy爬虫的比较 (1)相同点 (2)不同点 (3)选用哪个技术路线开发爬虫 4、Scrapy爬虫的...

wyatt007的博客 472

Python3.7网络爬虫入门笔记----安装Scrapy(Windows)

Scrapy是基于Twisted框架,用Python语言编写的跨平台开源网络爬虫框架。Scrapy的应用程序也是是用Python进行开发的,目前支持Python 2.7及Python3.4+版本。 在任意系统下都可以用pip安装Scrapy, 然而简单的在shell里(即cmd)用“pip install scrapy”会遇到很多问题导致安装失败,特别是在Windows系统上。因为一些最重要的拓...

vivi_in_purple的博客 4530

Python 网络爬虫笔记10 -- Scrapy 使用入门

Python 网络爬虫笔记10 – Scrapy 使用入门 Python 网络爬虫系列笔记是笔者在学习嵩天老师的《Python网络爬虫与信息提取》课程及笔者实践网络爬虫笔记。 课程链接:Python网络爬虫与信息提取 参考文档: Requests 官方文档(英文) Requests 官方文档(中文) Beautiful Soup 官方文档 re 官方文档 Scrapy 官方文档(英文) Scr...

Wang_Jiankun的博客 579

Python 网络爬虫笔记11 -- Scrapy 实战

Python 网络爬虫笔记11 – Scrapy 实战 Python 网络爬虫系列笔记是笔者在学习嵩天老师的《Python网络爬虫与信息提取》课程及笔者实践网络爬虫笔记。 课程链接:Python网络爬虫与信息提取 参考文档: Requests 官方文档(英文) Requests 官方文档(中文) Beautiful Soup 官方文档 re 官方文档 Scrapy 官方文档(英文) Scrap...

Wang_Jiankun的博客 739

Python网络爬虫与信息提取》第四周 网络爬虫之框架 学习笔记(二)Scrapy爬虫基本使用

目录 二、Scrapy爬虫基本使用 1、Scrapy爬虫的第一个实例 (1)演示HTML地址 (2)产生步骤 (3)小结 2、yield关键字的使用 (1)yield关键字 (2)实例 (3)为何要有生成器? 3、Scrapy爬虫的基本使用 (1)Scrapy爬虫的使用步骤 (2)Scrapy爬虫的数据类型 (3)Scrapy爬虫提取信息的方法 (4)CSS Selector的基本使用 二、Scrapy爬虫基本使用 1、Scrapy爬虫的第一个实例 (1)演示HTML地址

wyatt007的博客 441

Python网络爬虫学习笔记 -第七章:Scrapy分布式爬虫实践

课程地址 https://edu.csdn.net/course/detail/24756/280664 文章目录

alex100的博客 444

我的Python学习笔记(6) 初探网络爬虫scrapy

引用来源,《Python网络爬虫实战》,不过这本书不太推荐,很多错别字和错误的地方,代码也不标准。不知道是否过时了。。文中的例子是自己改的,因为书中的网站已经不能访问了。所以说明和代码分开看吧。 因为代码是我后来改的。后来发现还是看规范的教程比较好,这本书实在是不推荐了。Github地址创建工程可以通过下面的语句来创建工程cdcd code/crawler/scrapyProject/scrapy

长歌行 992

Python Scrapy爬虫笔记

1 开发环境: Centos6.0 ,Scrapy,Python3.6,Mongodb3.6,Pycharm 2.安装Scrapy,首先需要安装Lxml,twisted,Pywin32 --一定要下对应版本。 可参考:https://blog.csdn.net/dvivily/article/details/81325337 3.Scrapy的介绍: Scrapy:是一套基于Twi...

cyzfd_sunshine的博客 298

Python网络爬虫与信息提取》第四周 网络爬虫之框架 学习笔记(三)“股票数据Scrapy爬虫”实例

目录 三、“股票数据Scrapy爬虫”实例 1、“股票数据Scrapy爬虫”实例介绍 (1)功能描述 (2)数据网站的确定 2、“股票数据Scrapy爬虫”实例编写 3、“股票数据Scrapy爬虫”实例优化 三、“股票数据Scrapy爬虫”实例 1、“股票数据Scrapy爬虫”实例介绍 (1)功能描述 技术路线:scrapy。 目标:获取上交所和深交所所有股票的名称和交易信息。 输出:保存到文件中。 (2)数据网站的确定 获取股票列表: 东方财富网:http://quote.e

wyatt007的博客 758

探索Scrapy笔记:掌握Python爬虫的强大工具

探索Scrapy笔记:掌握Python爬虫的强大工具 去发现同类优质开源项目:https://gitcode.com/ 在这个数字化的时代,数据是无价的资源。而要获取大量网络数据,最好的工具之一就是Scrapy,一个强大且灵活的Python爬虫框架。本文将带你走进【ZhiqiKou】在GitCode上分享的Scrapy_notes项目,它是一个详细的Scrapy学习和实践指南,帮助你快速上手并精通...

gitblog_00087的博客 334

Python爬虫Scrapy笔记

视频教学网址: https://www.bilibili.com/video/BV124411A7Ep 部分源代码都是我自己手打的已经上传到Github: https://github.com/CocaineCong/Python_Spider_demo 这边是高级篇,基础篇在另一篇博客 https://blog.csdn.net/weixin_45304503/article/details/105581137 如果有什么问题欢迎指正,一起交流,一起学习。 需要md文件的可以评论或是私信 4)爬虫第四步

面向生活编程 1912

笔记】慕课-Python网络爬虫与信息提取-Scrapy框架(1)

Scrapy 网络爬虫原理 专业爬虫框架 5+2结构 爬虫框架:实现爬虫功能的一个软件结构和功能组件集合 5+2结构:五个模块,两个中间件 已有实现,不需要修改: ENGINE SCHEDULER 、DOWNLOADER 用户编写(配置): SPIDER(入口)、 ITEM、 PIPELINES(出口) ENGINE 控制所有模块之间的数据流 根据条件触发事件 DOWNLOADER 获得请求,并根据请求下载网页 SCHEDULER 调度和管理所有爬虫请求 中间件DOWNLOADER MIDDLEWARE

shupppppppy的博客 237

笔记】慕课-Python网络爬虫与信息提取-Scrapy框架(2)

Scrapy命令行格式 > scrapy <command>[options][args] 命令行更好自动化,适合脚本控制 Scrapy的具体命令 [options] [args] Scrapy的常用命令: startproject scrapy startproject [dir] 创建一个新工程 genspider scrapy genspider [options] 创建一个爬虫 settings scrapy settings [options] 获得爬虫配置信息 cr

shupppppppy的博客 323

Python自学笔记Scrapy爬虫项目创建&代码

Python自学笔记Scrapy爬虫项目创建&代码 创建爬虫项目 --> 需要在终端(cmd/Terminal)中通过代码创建 –>cd 进入创建项目的目录 scrapy startproject xxx # xxx是您需要创建爬虫项目的名称 cd xxx # 进入刚刚创建的爬虫项目目录 # 创建一只爬虫 注意:爬虫名不能和前面的爬虫项目名字相同! scrapy ge...

XiaoqiangClub的博客 789
上一篇: Python之字符串切片
下一篇: TCP/IP、HTTP详解
frozen_memory
博客等级 码龄9年 3粉丝 15原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值