小猫咪能有什么坏心思呢?只是想要你带它回家啦~

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情

前言

嗨喽!大家好,这里是魔王。

养猫是吸猫时代的一种潮流趋势,越来越多的喵星人开始参与了人类的家庭,猫奴们为了满足自己爱猫的狂热,都纷纷 开始抱猫咪回家。猫咪这种生物有谁能拒绝呢? 那么我们今天就来爬一爬猫咪交易网站
在这里插入图片描述

本此目的:Python爬取猫咪交易网数据

本次亮点

  1. parsel解析模块的使用
  2. requests模块的使用
  3. 保存csv

环境介绍:

  • python 3.8

    最新会有bug 版本没有那么稳定, 有一些模块出现不兼容的情况 所以使用python 3.8

  • pycharm

模块使用:

  • csv
  • requests >>> pip install requests
  • parsel >>> pip install parsel (用这个模块会报错) (3.7没有lxml 安装parsel会报错)

win + R 输入cmd 输入安装命令 pip install 模块名 (如果你觉得安装速度比较慢, 你可以切换国内镜像源)
在这里插入图片描述

python可以实现操作的东西

  1. 网站开发 (Django/flask/tornado)

    开发一个网站/ 今天爬取的内容 同样也可以用python开发出来的

    豆瓣/美团/youtube python开发

  2. 爬虫程序

    采集网页数据内容 (可见即可爬)

  3. 数据分析

    可视化图表展示/数据处理 清洗等等 量化交易 金融分析 …

    (算法 训练模型 可以达到预测效果>>> 下个月走势)

  4. 人工智能

    算法方面内容 >>> 人脸检测/物体识别 等等

  5. 自动化脚本

    游戏开发/游戏辅助 模拟点击/内存辅助 ce 去找参数变化, 然后用python修改
    在这里插入图片描述

思路

  1. 确定自己爬取的内容是什么东西
  2. 去分析我们爬取数据内容是从哪里来得 (可以爬慢一点/ 你可以破解验证码 自动识别验证码)

代码实现步骤(本网站内容是静态网页):

  1. 发送请求, 对于猫咪列表页发送请求
  2. 获取数据, 获取网页源代码
  3. 解析数据, 提取猫咪详情页url地址 以及 地区
  4. 发送请求, 对于猫咪详情页url地址发送请求
  5. 获取数据, 获取网页源代码
  6. 解析数据, 提取猫咪相关信息
  7. 保存数据, 把数据保存到csv文件
  8. 多页数据采集

导入模块

import requests  # 数据请求模块 第三方模块 pip install requests

import parsel  # 数据解析模块 第三方模块 pip install parsel

import csv  # 内置模块  

在这里插入图片描述

打开一个文件 csv文件 mode 保存方式 a encoding 编码 newline

f = open('猫咪data.csv', mode='a', encoding='utf-8', newline='')
csv_writer = csv.DictWriter(f, fieldnames=[
    '地区',
    '店名',
    '标题',
    '价格',
    '浏览次数',
    '卖家承诺',
    '在售只数',
    '年龄',
    '品种',
    '预防',
    '联系人',
    '联系方式',
    '异地运费',
    '是否纯种',
    '猫咪性别',
    '驱虫情况',
    '能否视频',
    '详情页',
])
csv_writer.writeheader() # 写入表头

在这里插入图片描述

猫咪的列表页url

for page in range(1, 21):
    print(f'--------------------正在爬取滴{page}页数据内容--------------------')
    url = f'http://www.maomijiaoyi.com/index.php?/chanpinliebiao_c_2_{page}--24.html'
    # headers 请求头, 把python代码进行一个简单伪装 (禁止LB 穿上一个外套)
    # 巳月老师 比较流氓, 对于没什么反爬网站, 都是LB
    # 我喜欢穿衣服
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.71 Safari/537.36'
    }
    # requests 里面 get 请求方式  为什么老师这里需要用get请求方式?
    response = requests.get(url=url, headers=headers)
    # 获取网页源代码 response.text 激发学员学习的兴趣
    # print(response.text) # 取网页源代码 html 字符串数据
    # 解析数据  不会css 或者xpath 没有关系 (不能经常用)
    selector = parsel.Selector(response.text)
    href = selector.css('#content div.breeds_floor div div a::attr(href)').getall()
    areas = selector.css('#content div.breeds_floor div div a div.price_area div.area span.color_333::text').getall()

在这里插入图片描述

同时提取两个列表里面的元素内容

  for index in zip(href, areas):
        # 返回的是元祖 >>> 根据索引位置取值 ()
        # http://www.maomijiaoyi.com/index.php?/chanpinxiangqing_404056.html
        # 猫咪详情页url地址
        index_url = 'http://www.maomijiaoyi.com' + index[0]
        # 字符串 方法去除字符串两端的空格 strip()  在爬取数据的过程中 也要对于数据进行一些简单处理
        # 方便我们之后做数据分析
        # css 选择器 这个里面语法还是比较多的, 像VIP课程 这个知识点会讲两个小时(详细)
        # css选择器 就是根据标签属性提取内容 解析方法: re正则表达式 css选择器 xpath (都要掌握)
        area = index[1].strip()
        html_data = requests.get(url=index_url, headers=headers).text
        selector_1 = parsel.Selector(html_data)
        title = selector_1.css('.detail_text .title::text').get().strip()
        shop = selector_1.css('.dinming::text').get().strip()  # 店名
        price = selector_1.css('.info1 div:nth-child(1) span.red.size_24::text').get()  # 价格
        views = selector_1.css('.info1 div:nth-child(1) span:nth-child(4)::text').get()  # 浏览次数
        # replace() 替换
        promise = selector_1.css('.info1 div:nth-child(2) span::text').get().replace('卖家承诺: ', '')  # 浏览次数
        num = selector_1.css('.info2 div:nth-child(1) div.red::text').get()  # 在售只数
        age = selector_1.css('.info2 div:nth-child(2) div.red::text').get()  # 年龄
        kind = selector_1.css('.info2 div:nth-child(3) div.red::text').get()  # 品种
        prevention = selector_1.css('.info2 div:nth-child(4) div.red::text').get()  # 预防
        person = selector_1.css('div.detail_text .user_info div:nth-child(1) .c333::text').get()  # 联系人
        phone = selector_1.css('div.detail_text .user_info div:nth-child(2) .c333::text').get()  # 联系方式
        postage = selector_1.css('div.detail_text .user_info div:nth-child(3) .c333::text').get().strip()  # 包邮
        purebred = selector_1.css(
            '.xinxi_neirong div:nth-child(1) .item_neirong div:nth-child(1) .c333::text').get().strip()  # 是否纯种
        sex = selector_1.css(
            '.xinxi_neirong div:nth-child(1) .item_neirong div:nth-child(4) .c333::text').get().strip()  # 猫咪性别
        video = selector_1.css(
            '.xinxi_neirong div:nth-child(2) .item_neirong div:nth-child(4) .c333::text').get().strip()  # 能否视频
        worming = selector_1.css(
            '.xinxi_neirong div:nth-child(2) .item_neirong div:nth-child(2) .c333::text').get().strip()  # 是否驱虫
        dit = {
            '地区': area,
            '店名': shop,
            '标题': title,
            '价格': price,
            '浏览次数': views,
            '卖家承诺': promise,
            '在售只数': num,
            '年龄': age,
            '品种': kind,
            '预防': prevention,
            '联系人': person,
            '联系方式': phone,
            '异地运费': postage,
            '是否纯种': purebred,
            '猫咪性别': sex,
            '驱虫情况': worming,
            '能否视频': video,
            '详情页': index_url,
        }
        csv_writer.writerow(dit)
        print(title, area, shop, price, views, promise, num, age,
              kind, prevention, person, phone, postage, purebred, sex, video, worming, index_url, sep=' | ')

在这里插入图片描述
在这里插入图片描述
好了,我的这篇文章写到这里就结束啦!

希望你在python这条路上依心而行,别回头,别四顾。一如既往不改初见的模样,未来的路很长,不管怎样,一定要相信自己一直走下去。

有更多建议或问题可以评论区或私信我哦!一起加油努力叭(ง •_•)ง

什么猫咪最受欢迎?Python爬取全网猫咪图片,哪一款是你最爱的 工具准备 开发工具:pycharm 开发环境:python3.7, Windows11 使用工具包:requests 项目思路解析 做爬虫案例首先需要明确自己的采集目标,白又白这里采集的是当前网页的所有图片信息,有目标后梳理自己的代码编写流程,爬虫的基本四步骤: 第一步:获取到网页资源地址 第二步:对地址发送网络请求 第三步:提取对应数据信息 提取数据的方式一般有正则、xpath、bs4、jsonpath、css选择器 第四步:保存数据信息 第一步:找数据地址 数据的加载方式一般有两种 阅读详情

相关推荐

基于PHP的猫咪宠物网

Java毕业设计、计算机毕业设计、毕业论文、毕业答辩、毕业设计资料、最新毕业设计,提供设计资料,设计方案,毕业文案,论文文档,php计算机毕业设计 java计算机毕业设计 c#计算机毕业设计 计算机毕业设计 毕业论文 毕业答辩 计算机毕业设计 小程序毕业设计, 基于SSM计算机毕业 设计基于SSH计算机毕业设计 基于SpringBoot计算机毕业设计 Mysql计算机毕业设计 管理系统 计算机毕业设计免费论文 计算机毕业设计免费源码 计算机毕业设计答辩PPT 计算机毕业设计开题报告 计算机毕业设计

毕业设计大牛哥 4722

相见恨晚的超实用网站

转载,侵权删 原文链接:https://blog.csdn.net/qq_43901693/article/details/100606828 顺便推荐一款个人非常喜欢的搜索引擎:多吉搜索 www.dogedoge.com 正文: 搞学习 知乎:www.zhihu.com 简答题:http://www.jiandati.com/ 网易公开课:https://open.163.com/ted/ 网易...

adgddvhhg的博客 4万+

Harness Engineering:Agent工具调用权限最小化

先给大家讲个真实的小例子——假设你是一个忙碌的程序员,家里还在装修,你对着手机里的语音助手(其实是个工具调用的大模型Agent)说:“帮我看看今天钉钉上有没有未读的紧急代码评审,再查一下装修公司的账户余额,最后把阳台门的安装时间改到明天下午3点之后(因为明天上午我要开重要的周会)。调用「钉钉未读消息查询API」找出紧急评审;调用「装修公司合作银行的第三方支付查询API」看余额;调用「装修公司的订单管理系统API」修改安装时间;最后用自然语言把结果整理好告诉你。你看!这就是AI Agent的。

AGI×大数据,开启智能时代的认知跃迁;解码AGI,赋能数据驱动的智能革命。 357

打开小猫咪之后,国内的网站打不开了,怎么办。原因是dns解析出了问题

打开小猫咪之后,国内的网站打不开了,怎么办。原因是dns解析出了问题 关闭远程dns解析功能即可

Kp0fS的草稿纸 1万+

猫咪APP 服务器不稳定,猫咪app网速很慢(猫咪网速很差怎么解决)

PINg一下DNS看有没有丢包的情况,如果丢包和延时大,就打电话电他们来修,如果没有,你看自己电脑的设置有没有问题。如果是打开IE变慢,而下载文件速度变化不大.每次开机以后都要等10分钟左右才可以联网,有的时候还掉线。无论采用什么形式上网,都会遇到计算机上网慢(卡、上不去网、信号差、不稳定、. 7:提醒:理论上:用软件提高你的网络速度是十分渺茫,其实你是感觉不到的,一.网速慢主要是有以上的原因造成...

weixin_31971181的博客 12万+

小猫咪不喝水怎么办?主食冻干、主食罐头喂养从饮食上给猫咪补水

我家的就是典型的不爱喝水的小猫,早些年为了让我家猫多喝水我也是费尽了心思,网上说的勤更换水碗、多放水碗、更换电动饮水机、酸奶机、加猫薄荷都试过了,就加猫薄荷稍微给点面子...但那玩意可以算是“猫中毒品”,长期吃还会免疫,也不能天天用猫薄荷来骗水。猫的祖先、或是在野外生存的猫咪从猎物中摄取水分,通过摄取猎物的体液(如血液、组织液等)来补充自身所需的水份,猫捕捉的猎物含水量一般在70% - 75%。因此,为了满足猫的饮水需求,最有效解决猫不喝水的办法,我们可以从模仿其饮食天性入手,提供富含水分的食物。

2301_80322634的博客 1319

一切为了喵喵 | 攻防世界 x Nepnep x CATCTF邀你一战!

一切为了喵喵 | 攻防世界 x Nepnep x CATCTF邀你一战!

Cyberpeace的博客 977

机器学习梗图大赏

点击上方“AI遇见机器学习”,选择“星标”公众号重磅干货,第一时间送达文 | 白鹡鸰图 | 白鹡鸰 小轶大家好呀,我是日常遭到小轶摁头赶稿的白鹡鸰~最近的投稿高峰期各位都过得如何呢?白鹡鸰...

weixin_36896856的博客 2020

在给猫起名字这件事上,铲屎官们绝对是个鬼才!

大家刚把小猫咪回家的时候,最重要的事情是啥?除了忙着买一些猫粮、猫窝等猫咪必需用品,最重要的事情应该就是给小猫咪取名字啦!俗话说:名字取得好,猫咪养到老,不怕生病没烦恼。名字不好听的猫咪在亲戚朋友、喜欢的小母猫面前都抬不起来头。一个没给猫起过名字的人类,恐怕永远没机会知道自己的词汇量是多么贫瘠。讲真,有多少铲屎官表面上才华横溢,私底下却为了给猫起个名字秃了头、爆了肝,个中辛苦只有喵才知道。为此,小编特意暗访了十几个宠物群,在采访多个铲屎官之后发现,养猫青年给猫子们起名字这方面,实在skr鬼才!下边大家就跟

a309147563的博客 2万+

编程无需类?探索原型编程的奇妙之旅

想象一下,你有一块黏土,你可以用它塑造一个小猫咪的形状,这个小猫咪就是一个对象。现在,如果你想要更多相似的小猫咪,你可以用这个已经塑造好的小猫咪作为模板,继续塑造更多小猫咪。这就是基于原型编程的核心思想,你不需要先定义黏土的“类别”,而是直接塑造对象,然后复制它就行了。

程序员,AI探索者 962

【机器学习】专业人士才能看得懂的机器学习梗图大赏

文 | 白鹡鸰图 | 白鹡鸰 小轶大家好呀,我是日常遭到小轶摁头赶稿的白鹡鸰~最近的投稿高峰期各位都过得如何呢?白鹡鸰要偷偷爆料,最近的小轶可是超级辛苦的~不过白鹡鸰还很轻松,毕竟已经决定...

fengdu78的博客 1708

fst 共享后缀_关于Lucene的词典FST深入剖析

核心是在于如何快速的依据 查询词 快速的查找到所有的相关文档,这也是 倒排索引(Inverted Index) 的核心思想。那么如何设计一个快速的(常量,或者1)定位词典的数据结构就显得尤其重要。简单来说,我们可以采用HashMap, TRIE, Binary Search Tree, Tenary Search Tree等各种数据结构来实现。那么开源的搜索引擎包Lucene是怎么来设计的呢?Lu...

weixin_33480380的博客 635

模拟人生5显示与服务器,模拟人生5之人生无限

不知道怎么下载?点我游戏介绍在模拟市民的家庭中似乎就缺少一丝生气?就是宠物。前所未见的突破设计,在《模拟人生5之人生无限》中,市民们可以将宠物朋友变成家庭中的一份子。逛逛宠物店,买几只小狗小猫来加入我们吧。社区面积变得更加宽阔,新增加了住宅区。在这些地方在这些地方多了公园、咖啡厅、菜市场等地点,让您的模拟市民以及他们的宝贝宠物有个更多彩多姿的社区生活!【游戏特色】可爱的家庭宠物:去宠物店帮模拟市民...

weixin_32239523的博客 421

GME-Qwen2-VL-2B-Instruct 创意应用:短视频自动生成文案与标签

本文介绍了如何在星图GPU平台上自动化部署GME-Qwen2-VL-2B-Instruct镜像,实现短视频内容创作的效率提升。该多模态模型能根据视频关键帧,快速生成吸引人的标题、文案描述及热门标签,为创作者提供了一个高效的“AI文案助理”,尤其适用于需要日更或灵感枯竭的场景。

weixin_35757531的博客 27

ReactiveCocoa入门教程——第一部分

作为一个iOS开发者,你写的每一行代码几乎都是在响应某个事件,例如按钮的点击,收到网络消息,属性的变化(通过KVO)或者用户位置的变化(通过CoreLocation)。但是这些事件都用不同的方式来处理,比如action、delegate、KVO、callback等。ReactiveCocoa为事件定义了一个标准接口,从而可以使用一些基本工具来更容易的连接、过滤和组合。 如果你对上

mgr406176009的专栏 694

关于Lucene的词典FST深入剖析

搜索引擎为什么能查询速度那么快? 核心是在于如何快速的依据查询词快速的查找到所有的相关文档,这也是倒排索引(Inverted Index)的核心思想。那么如何设计一个快速的(常量,或者1)定位词典的数据结构就显得尤其重要。简单来说,我们可以采用HashMap, TRIE, Binary Search Tree, Tenary Search Tree等各种数据结构来实现。 那么开源的搜索引擎包Lucene是怎么来设计的呢?Lucene采用了一种称为FST(Finite State Transducer)的结构

Koikoi12的博客 1764
上一篇: python爬取某音乐歌词,将内容保存制作词云图
下一篇: python多线程爬表情包,斗图斗够瘾~
魔王不会哭
博客等级 码龄5年 6002粉丝 394原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值