python爬取虎嗅网首页新闻超链接、图片链接、标题

限时加码!20+主流AI编程工具免费用 购周边加赠Coding Plan Lite,Claude Code、Cursor等即刻畅享,学习进阶更高效! 阅读详情

要求:爬取该网站首页内容,即获取每一个超链接、图片链接、标题,以.CSV存储(一行就是一个新闻的超链接、图片链接、标题)


建议直接点正文👆

用不上的思考过程

1.新闻超链接存在于a的herf属性中,/article/408795.html,前面要加上https://www.huxiu.com

2.图片链接暂时还不知道存在哪

https://img.huxiucdn.com/article/cover/202102/06/102020604605.jpg?imageView2/1/w/800/h/450/|imageMogr2/strip/interlace/1/quality/85/format/jpg

3.标题存在于img alt和h5节点下的内容中,h5.string

img alt查了一下,是为了不能正确看到图片而显示出的标签。所以标题存在于h5节点下的内容

爬取的网站源码

功夫不负有心人,在我不断往下滑的时候瞟到了熟悉的题目

image-20210206132537147

news下的focus下的title是标题,pic_path是图片链接,但在每个节点前加了u002F,第一个\u200F要去掉,后面都要去除u002F

上面属于网站的 新闻聚焦 部分

再往下滑

image-20210206134401245

但是这貌似不是首页的新闻,有些找不到,但是它这个新闻标题,链接和图片链接都能找得到

标题存放于title项

链接存放于share_url

图片链接存放于pic_path

链接和图片链接都要删除掉一定内容(u002F)


正文

首页源代码下有些新闻标签没有标图片链接,有些甚至没标题~~(这就离谱)~~ ,陷入了思考…

我突然想到,可以先进入网址再查看图片和标题

希望他每个网页不要布局不太一样…

仔细观察了几个新闻页面的源代码,所幸,是一样的

所以现在的步骤应该是:

1.用一定的手法找到所有新闻链接

2.获取新闻链接后,进入,获取图片链接和标题

3.按格式存储入文件

现在要在新闻页面中进行操作,提取出标题和图片链接(问了一下我哥,他说要学正则表达式,我就认真看了看正则

1.观察新闻页面源码

image-20210207233814947

2.编写代码提取信息

通过观察可以得知:

图片链接:meta的content属性

根据网页源码写了正则表达式,可以提取出来。不过findall以列表形式返回,所以[0]取单个元素。

标题:title节点的内容

可由BeautifulSoup直接拿出,soup.title.string,不过显示多了-虎嗅网,通过split方法取出即可

image-20210208122254828

3.观察首页源码并编写正则表达式

现在已经搞定一个新闻的了,现在就是差得到新闻链接了~

所以我要写一个提取新闻网址的正则表达式

所以我们得观察一下新闻网址前后的内容

首页源代码的新闻网址a节点的href属性

image-20210207233726245

首页的新闻

视频新闻部分的a节点是这样的

 <div class="article-item article-item--normal" data-v-0c506fb6=""&
关于爬虫时页中含unicode编码导致正则无法正确匹配的问题 最近在爬取今日头条时 出现了正则无法正确匹配url问题 不使用'unicode-escape'方法下 现已解决 希望能帮助各位小伙伴 ![在这里插入图片描述](https://img-blog.csdnimg.cn/2020041111534485.png#pic_center) 欲匹配的url如图 开始我使用的正则格式为 import re headers = { 'u... 阅读详情

相关推荐

人民新闻抓取Python(内附完整代码)

本文在遵守Robots友好爬虫协议的前提下,在原始新闻列表页面向Web服务器发送携带cookies的请求,提取出子页面超链接,并存储成URL列表。遍历列表,通过selenium模拟浏览器技术,获得每一个子页面的页内容,而后使用正则表达式、BeautifulSoup库的css选择器,find,findall,select等查找提取元素方法,获取子页面的新闻标题新闻时间,报道来源,内容,责任编辑,如果页面存在图片或视频元素,提取其超链接后再次发送请求,下载页内嵌多媒体

Pierre_Bezuhov的博客 4192

正则表达式提取址、标题、图片等一例(.Net Asp Javascript/Js)的实现

在一些抓取、过滤等情况下, 正则表达式 regular expression 的优势是很明显的。 例如,有如下的字符串: 代码如下:<li><a><span class=”article-date”>[09/11]</span>FCKEditor高亮代码插件测试</a></li> 现在,需要提取 href 后面的址,[]内的日期,和 链接的文字。 下面给出C#, ASP 和 Javascript 的实现方式 C#的实现 代码如下

Selenium动态页爬虫实战:从环境搭建到反反爬策略

络爬虫是自动化获取互联公开数据的关键技术,其核心原理是模拟客户端向服务器发送请求并解析响应。对于静态页,传统的请求-解析模式效率很高。然而,随着Web 2.0技术的发展,大量站采用JavaScript动态渲染内容,数据在初始HTML中并不存在,这给传统爬虫带来了挑战。此时,浏览器自动化工具的价值便凸显出来,它能够驱动真实浏览器执行JavaScript,完整渲染页面后再提取数据,从而有效解决动态内容抓取难题。Selenium作为主流的浏览器自动化工具,在Python爬虫生态中扮演着重要角色,尤其适用于

aoe41606的博客 527

文章爬虫

文章爬虫,爬去首页的文章,并存储到mysql中。

python入门011~python3爬虫 爬取图片,爬取新闻站文章并保存到数据库

先自我介绍一下,小编浙江大学毕业,去过华为、字节跳动等大厂,目前阿里P7深知大多数程序员,想要提升技能,往往是自己摸索成长,但自己不成体系的自学效果低效又漫长,而且极易碰到天花板技术停滞不前!因此收集整理了一份《2024年最新Python全套学习资料》,初衷也很简单,就是希望能够帮助到想自学提升又不知道该从何学起的朋友。 既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,涵盖了95%以上Python知识点,真正体系化!由于文件比较多,这里只是将部分目录截图出来,全套

2401_84140060的博客 799

爬取络图片并保存到本地_python3实战入门爬虫篇---页爬虫,图片爬虫,新闻站爬虫...

2019年4月16日零基础入门Python,第二天就给自己找了一个任务,做站文章的爬虫小项目,因为实战是学代码的最快方式。所以从今天起开始写Python实战入门系列教程,也建议大家学Python时一定要多写多练。目标1,学习Python爬虫2,爬取新闻新闻列表3,爬取图片4,把爬取到的数据存在本地文件夹或者数据库5,学会用pycharm的pip安装Python需要用到的扩展包一,首先看看Py...

weixin_39646970的博客 641

Python3 爬虫学习笔记】用PySpider爬取并进行文章分析

–转自《1900-高级农民工》http://www.makcyun.top 安装并运行pyspider 安装pyspider pip3 install pyspider 运行pyspider并创建爬虫项目huxiu pyspider all 成功后,如下图所示: 在浏览器中输入:http://localhost:5000或者http://127.0.0.1:5000 点击Create,输入...

冰度猎魂的博客 860

Python爬虫处理\xa0、\u3000、\u2002、\u2003等空格

Python爬虫正则匹配特殊特殊空格\u3000、\xa0等

东隅已逝,桑榆非晚。 1万+

python抓取页面文本及图片超链接

自定义标题目标页[baidu]:一、爬取页全部标签址:1、按F12进入开发者模式查看HTML:2、分析HTML结构:3、代码如下:4、运行结果:二、爬取超链接文字及对应址:优化代码如下:进一步优化方案:三、页面图片超链接:1、代码如下: 这里用到第三方库:Beautiful Soup(一个可以从HTML或XML文件中提取数据的Python库) 目标页[baidu]: 一、爬取页全部标...

yeyuanxiaoxin的博客 5063

爬虫技术-ChatGPT4o作答

爬虫技术在当今互联世界中具有广泛的应用,可以帮助我们从海量的络数据中提取有用的信息。然而,爬虫开发过程中需要充分考虑道德和法律问题,合理控制抓取频率,避免对目标站造成过大压力,同时遵守相关的规范和规则。

qq_46215223的博客 1479

python3怎么把\u002F这种类型的字符进行对应的替换

slashUStr = "https:\u002F\u002Fm.dhgate.com\u002Fproduct\u002Fsnoop-dogg-doggystyle-album-logo-black-white\u002F427954156.html" decodedUniChars = slashUStr.encode('utf-8').decode("unicode_escape") print("decodedUniChars=", decodedUniChars)

南巷清风 1万+

pythonscrapy爬取文章

python scrapy爬取文章

python 爬虫之序列化html问题--文本处理(\u003C\u002Fem\u003E)

文本处理(\u003C\u002Fem\u003E)

weixin_45299811的博客 2523

python爬虫出现中文出现u“\uXXXX“详细解决办法

今天爬虫爬到的内容出现u"\uXXXX" 解决办法如下: import json #加入打印的数据为data print (json.dumps(data).decode('unicode-escape'))

记录并分享学习安全的知识点.. 1932

Python爬取新闻站的标题和链接存入Excel

最近爬取的一个新闻站的标题新闻页的链接还有发布时间。用到了BS4和re,在对要进行爬取页url处理时,我选择的是放入Quene中,调用。其实放入set()或者存为txt都可以。 正则用的不是太66,所以正则部分显得有点牵强。 数据存储选择为Excel,可以存为MySQL的,代码还没写,稍后会添加进来。代码还有不足之处,在做修改。 # coding:utf-8 import reques...

weixin_43857152的博客 3804

python爬取数据

2019独角兽企业重金招聘Python工程师标准>>> ...

weixin_34319111的博客 552

自定义轮播图(banner图)

public class MyBannerActivity extends AppCompatActivity { private String[] picUrl = { "https://img.huxiucdn.com/article/cover/201804/11/142701198959.jpg?imageView2/1/w/710/h/400/|ima...

weixin_41649874的博客 464

python3爬虫-爬取新浪新闻首页所有新闻标题

准备工作:安装requests和BeautifulSoup4。打开cmd,输入如下命令pip install requests pip install BeautifulSoup4打开我们要爬取的页面,这里以新浪新闻为例,地址为:http://news.sina.com.cn/china/按F12打开开发人员工具,点击左上角的图片,然后再页面中点击你想查看的元素:我点击了新闻标题处的元素,查看到该元

Alan_Xiang的博客 1万+

python 爬虫实战(三)使用pyspider爬取新闻

#!/usr/bin/env python # -*- encoding: utf-8 -*- # Created on 2018-03-02 23:14:26 # Project: huxiu from pyspider.libs.base_handler import * class Handler(BaseHandler): crawl_config = { } ...

JonPia的博客 1569
上一篇: 使用 Beautiful Soup
下一篇: pycharm使用anaconda下载的库
Horace_01
博客等级 码龄6年 147粉丝 36原创
评论 1
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值