python-电影天堂爬取

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情
import re
import urllib.request
import sys
from bs4 import BeautifulSoup
import xlwt
import os

# 爬取电影天堂的最新的电影前10页,并保存在Excel表中
url = "https://dy.dytt8.net/html/gndy/dyzz/list_23_1.html"

# 电影名称正则
# link = re.compile(r'<td colspan="2" style="padding-left:3px">(.*?)</td>')
# <a href="/html/gndy/dyzz/20230630/63862.html" class="ulink">2023年动作悬疑《暴风/绝密使命》HD国语中英双字</a>
# link = re.compile('<a href="/html/gndy/dyzz/\d*/\d*/\./html".class="ulink">(.*?)</a>')
regex = r'>(20.*?)<\/a>'


# 抓取数据分析
def main():
    path = ".\\电影天堂.xls"
    # getdata()
    # askURL(url)a
    datalist = getdata()
    # 保存数据
    save(datalist, path)



# 网页请求
def askURL(url):
    head = {
        # 模拟请求信息伪装
        "User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36 Edg/114.0.1823.58"
    }
    request = urllib.request.Request(url, headers=head)   # 发送请求
    html = ""
    try:
        response = urllib.request.urlopen(request)   # 取得响应
        html = response.read().decode("gbk", errors="ignore")
        # print(html)
    except urllib.error.URLError as e:
        if hasattr(e, "code"):
            print(e.code)
        if hasattr(e, "reason"):
            print(e.reason)

    return html

def getdata():
    datalist = []
    for i in range(1, 16):
        url = "https://dy.dytt8.net/html/gndy/dyzz/list_23_{}.html".format(i)
        html = askURL(url)
        # 逐一分析数据
        soup = BeautifulSoup(html, "html.parser")
        for item in soup.find_all("div", class_="co_content8"):
            # data = []
            item = str(item)
            # print(item)
            # name = re.findall(link, item)
            data = re.findall(regex, item)
            datalist.append(data)
            # print(datalist)
    return datalist

            # for match in data:
            #     print(match)





"""
在这个代码中,我们首先检查指定的保存路径是否存在,如果不存在则创建该路径。
然后,我们创建一个 Workbook 对象 book,向其中添加了一个名为 Sheet1 的工作表 sheet。
接下来,我们使用两个循环遍历 datalist 中的数据,并将其逐个写入到 Excel 表格中。
最后,我们使用 book.save() 方法将数据保存到指定的文件中。

首先,我们定义了一个变量 col,用于表示当前要写入的列数。
        然后,我们使用一个 for 循环遍历 datalist 中的每一个子列表 data。
        在循环中,我们定义了另一个变量 row,用于表示当前要写入的行数,
        并使用另一个 for 循环遍历 data 中的每一个元素 item。
        在内层循环中,我们使用 sheet.write() 方法将当前元素 item 
        写入到 Excel 表格的第 row 行、第 col 列的单元格中。然后,我们将 row 的值加 1,以便写入下一行的数据
"""
def save(datalist, savepath):
    # 如果保存路径所在的目录不存在,则创建目录
    if not os.path.exists(os.path.dirname(savepath)):
        os.makedirs(os.path.dirname(savepath))

    # 创建一个Workbook对象,用于保存Excel文件
    book = xlwt.Workbook(encoding="utf-8", style_compression=0)

    # 创建一个Sheet对象,用于保存数据
    sheet = book.add_sheet("Sheet1", cell_overwrite_ok=True)
    row = 0
    col = 0
    for data in datalist:
        for item in data:
            # print("\n" + item)
            print(item)
            # print(f"Writing data: {item}")
            sheet.write(row, col, item)
            row += 1


    book.save(savepath)



if __name__ == '__main__':
    main()


python爬取电影天堂 爬取的网址: http://www.ygdy8.net/html/gndy/dyzz/list_23_1.html 使用的环境: pychram+anaconda5.4.7+python3.7.1 使用的函数库: requests+pyquery+csv+time 爬取思路:先在爬取的网址中得到电影详情页的网址,再访问详情页提取需要的信息。 网站分析: 关于翻页,网站第一页为http://www... 阅读详情

相关推荐

Python轻松爬取电影天堂:获取2024必看热片的电影名称与下载链接

在本篇博文中,我们将深入探讨如何使用Python的requests和BeautifulSoup库,轻松爬取电影天堂2024必看热片的电影名称和下载地址。无论你是编程新手还是有经验的开发者,这个项目都将帮助你掌握基本的网页爬取技巧,并为你打开数据获取的新大门。让我们开始这段有趣的旅程吧!

不迁怒,不贰过。小知识,大智慧。 2023

电影天堂上的Python爬虫源码.zip

【资源说明】 电影天堂上的Python爬虫源码.zip电影天堂上的Python爬虫源码.zip电影天堂上的Python爬虫源码.zip电影天堂上的Python爬虫源码.zip电影天堂上的Python爬虫源码.zip电影天堂上的Python爬虫源码.zip电影天堂上的Python爬虫源码.zip电影天堂上的Python爬虫源码.zip 1、该资源内项目代码都是经过测试运行成功,功能ok的情况下才上传的,请放心下载使用! 2、本项目适合计算机相关专业(如计科、人工智能、通信工程、自动化、电子信息等)的在校学生、老师或者企业员工下载使用,也适合小白学习进阶,当然也可作为毕设项目、课程设计、作业、项目初期立项演示等。 3、如果基础还行,也可在此代码基础上进行修改,以实现其他功能。 4、项目代码可做一定改动,也可直接用于毕设、课设、作业等。 欢迎下载,沟通交流,互相学习,共同进步!

Python爬虫框架:scrapy爬取迅雷电影天堂最新电影

项目开始 第一步仍然是创建scrapy项目与spider文件 切换到工作目录两条命令依次输入 scrapy startproject xunleidianying scrapy genspider xunleiBT https://www.xl720.com/thunder/years/2019 内容分析 打开目标网站(分类是2019年上映的电影),分析我们需要的数据 进入页面是列表的形式就像豆瓣电影一样,然后我们点进去具体页面看看 这个页面就是我们需要拿到的内容页面,..

爬遍所有网站 5994

python 电影天堂爬虫源文件

本文件是在python3下,编写的 一个简单的爬虫源码,大家可以交流一下。 本爬虫只适合于静态,通过分析 电影天堂网站,发现网站源码是静态的,固通过此方法将其下载地址进行抓取。

Python-pythonscrapy爬取电影天堂所有电影

python scrapy爬取电影天堂所有电影

Python爬取第一电影天堂最新电影(5000多部)代码实例(一)

1、实例代码: #!/usr/bin/env python #-*- coding: utf-8 -*- #@Time : 2020/4/7 16:28 #@Author : zhangliangliang #@File : crawlerDemo3.py #@Software: PyCharm from urllib import request from lxml import...

zll_1234的博客 1万+

Python抓取电影天堂,零基础都可以学?源码&视频,大赞!

我知道,大家肯定是看到Python源码&视频教程才进来的。小编说到做到,此次利用Python爬取电影天堂包含视频教程、以及源码。所以说零基础的Python新手也能够轻松学会,真的一点都不过分。 ...

cudykf6382的博客 5718

python 爬取电影天堂电影

主要介绍爬取电影天堂首页的电影列表,并将结果保存为csv文件. 1.首先导入需要的模块 import requests from bs4 import BeautifulSoup import csv 2.获取网页,并解析结果 def html_parser(url_start): #获取html try: headers={'User-Agent':'...

冻梨不是梨的博客 6372

教你如何用python爬取电影天堂上面的电影

1.首先导入需要的模块 import requests from bs4 import BeautifulSoup import csv 2.获取网页,并解析结果 def html_parser(url_start): #获取html try: headers={‘User-Agent’:‘Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36’.

weixin_50277536的博客 1796

Python爬取电影天堂资源

#这里的requests,re,urllib库是python自带的,lxml是通过pip下载的 from urllib import request,parse from lxml import etree import requests,re 步骤一:先爬取电影名和电影名相对应的详情链接 url1 = "https://www.dytt8.net/index0.html" ...

qq_37387886的博客 2万+

python 爬取_Python爬取电影天堂

前言:本文非常浅显易懂,可以说是零基础也可快速掌握。如有疑问,欢迎留言,笔者会第一时间回复。本文代码存于github一、爬虫的重要性:如果把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛通过网页的链接地址来寻找网页,从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它链接地址,然后通过这些链接地址寻找下一个网页,一直循环下去,直到把整个网站所有的网页都...

weixin_39847437的博客 737

01_python爬虫--爬取电影天堂

目标:获取电影天堂网站的 2024必看热片的电影名单,并获取每部电影的 '片名', '年代', '产地', '类别', '语言', '下载地址'。然后存入到csv文件中目标网址:https://dy2018.com/问题解决(分析): (1).数据如果在页面源代码,说明可以直接向服务端发送请求,然后可以获取到源代码,我们需要的数据就在源代码上。 (2).数据不在页面源代码上,那么数据很有可能使通过异步加载来加载数据的。什么使异步加载? 异步加载是:url表面没有发生变化的情况下,,加载出来了其他

2401_83322621的博客 9456

python翻页爬取电影天堂电影的磁力链接

python翻页爬取电影天堂电影的磁力链接 案例目的: 介绍如何通过首页的url提取详情页的url以及如何通过xpath语法提取详情页的数据。 代码功能: 输入要爬取的页数,自动保存电影的名称以及对应的磁力链接。 本次案例以国内电影为例。 1.找到主页的url: 2.找到电影名称对应的xpath节点: 3.找到详情页url对应的节点: 注:我们通过xpath获得的详情页的url都是不完整的,因此需要我们手动拼接。 4.在详情页查看电影的磁力链接: 5.找到详情页电影磁力链接对应的xpath语法:

coffeetogether的博客 4684

python爬取电影天堂实现电影自由

获取下载链接的代码同学们可以自己尝试着写下,把所有的链接都保存到一个txt文件,利用迅雷的批量下载功能进行下载。只要你的硬盘足够大,世界都能装的下。既然不返回数据给我们,那我们换个思路,利用selenium所见即所的功能,直接打开网站获取相关的数据就好了。经过分析后暗暗窃喜,跟之前一个套路,直接requests请求,xpth解析,数据不就手到擒来,开干。网站直接返回了一个javascript脚本,网站做了反爬,数据获取不到了......我们利用相同的方法,循环对获取的电影详情页面进行下载链接的获取。

2403_88996352的博客 3251

python爬取电影天堂新片精品模块电影列表,并用迅雷下载

python版本是3.6.5,上代码:# 爬取电影天堂 from selenium import webdriver import requests from bs4 import BeautifulSoup import os import pyperclip print('开始网页请求') #使用selenium通过PhantomJS来进行网络请求 driver=webdriver.Phan...

yotoai的博客 12万+

Python爬虫(二)——爬取电影天堂,保存下载地址

首先我们开始要分析一下,下载种子我们需要哪几步: 获取所有电影页的访问地址 获取电影页源码 提取出下载地址 将下载地址保存 首先第一步,我们来分析一下电影天堂网站的结构,发现他跟我们的古诗文网还是非常类似的,全站静网结构,不需要登录,页面有全新的地址,这对于初学来讲是非常容易上手的;接下来我们以国内电影(https://www.ygdy8.net/html/gndy/china/index...

geeknuo的博客 1万+

Python爬取电影天堂

本文非常浅显易懂,可以说是零基础也可快速掌握。如有疑问,欢迎留言,笔者会第一时间回复。

mate1357的博客 5259

python电影天堂_python爬虫爬取电影天堂电影

python爬虫爬取电影天堂电影?本项目实现一个简单的爬虫,通过requests和BeautifulSoup爬取电影天堂电影信息,包括片名、年代、产地、类别、语言、海报链接和视频链接等内容。python爬虫爬取电影天堂电影?(如果你还更多疑问,请点击>>>在线客服)如何理解工具准备python3.5 requests模块 BeautifulSoup模块 os模块 re模块 str...

weixin_39747975的博客 1122

Python笔记6——爬取电影天堂链接

如何简单爬取电影天堂里的电影链接并且写入自己本机的txt文件中?(看下面的代码,拿走不谢) import re import requests from lxml import etree url=" https://www.dytt8.net/" headers={'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/83.0.4103.97 Safar

萧鼎的博客 1352
上一篇: Python-删除指定名称结尾的文件
LeonTree09233
博客等级 码龄4年 1粉丝 15原创
评论 1
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值