用Python爬取2022春节档电影信息_Python

用Python爬取2022春节档电影信息

2022-09-04 11:33FriendshipT Python

大家好，本篇文章主要讲的是用Python爬取2022春节档电影信息，感兴趣的同学赶快来看一看吧，对你有帮助的话记得收藏一下

前提条件

熟悉HTML基础语句

熟悉Xpath基础语句

实验环境

Python 3.x （面向对象的高级语言）

Resquest 2.14.2 （python第三方库）

Pandas 1.1.0（python第三方库）

Time （python标准库）

Lxml（python第三方库）

具体步骤

目标网站

https://movie.douban.com/cinema/later/shenzhen/

用Python爬取2022春节档电影信息

分析网站

按F12打开浏览器操作台

用Python爬取2022春节档电影信息

按Ctrl+Shift+C快捷键

用Python爬取2022春节档电影信息

按Ctrl+F快捷键，控制台出现搜索框

用Python爬取2022春节档电影信息

复制Xpath

Xpath为//*[@id=“showing-soon”]/div[1]/div/h3/a

用Python爬取2022春节档电影信息

粘贴到搜索框，验证Xpath

用Python爬取2022春节档电影信息

查看HTML，寻找共性

用Python爬取2022春节档电影信息

发现目标元素都在一个div框里，修改Xpath

Xpath修改为//*[@id=“showing-soon”]/div/div/h3/a

用Python爬取2022春节档电影信息

其余目标元素，以此类推

用Python爬取2022春节档电影信息

最后，用Pandas保存为CSV文件

# 利用pandas保存文件
df = pd.DataFrame()
df["上映日期"] =  Ondate
df["片名"] =  name
df["类型"] =  movie_class
df["制片国家/地区"] = area
df["想看人数"] = num
df["超链接"] = href

用Python爬取2022春节档电影信息

代码实现

# -*- coding: utf-8 -*-
"""
Created on Tue Jan 25 10:07:11 2022
@author: TFX
"""
import time
import requests # 请求库
import pandas as pd
from lxml import etree# 提取信息库
# 日期
today = time.strftime("%Y{y}%m{m}%d{d}",time.localtime()).format(y="年",m="月",d="日")
# 网址
url = "https://movie.douban.com/cinema/later/shenzhen/"
# 请求头
headers = {
        "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.163 Safari/537.36"
        }
# 发送请求
response = requests.get(url=url,headers=headers)
# 数据解析,xpath可以用浏览器检查元素获得
html = etree.HTML(response.text) #类型变换
# 电影详细超链接
href = html.xpath("//*[@id="showing-soon"]/div/div/h3/a/@href")
# 上映日期
Ondate =  html.xpath("//*[@id="showing-soon"]/div/div/ul/li[1]/text()")
# 片名
name = html.xpath("//*[@id="showing-soon"]/div/div/h3/a/text()")
# 类型
movie_class = html.xpath("//*[@id="showing-soon"]/div/div/ul/li[2]/text()")
# 制片国家 / 地区
area = html.xpath("//*[@id="showing-soon"]/div/div/ul/li[3]/text()")
# 想看人数
num = html.xpath("//*[@id="showing-soon"]/div/div/ul/li[4]/span/text()")
# 利用pandas保存文件
df = pd.DataFrame()
df["上映日期"] =  Ondate
df["片名"] =  name
df["类型"] =  movie_class
df["制片国家/地区"] = area
df["想看人数"] = num
df["超链接"] = href
df.to_csv("2022春节档电影_"+today+".csv",mode="w",index=None,encoding="gbk")
print("保存完成!")