Python怎么爬取喜马拉雅音频数据-快上网网站建设公司

Python怎么爬取喜马拉雅音频数据

本篇内容主要讲解“Python怎么爬取喜马拉雅音频数据”，感兴趣的朋友不妨来看看。本文介绍的方法操作简单快捷，实用性强。下面就让小编来带大家学习“Python怎么爬取喜马拉雅音频数据”吧!

目前创新互联已为成百上千家的企业提供了网站建设、域名、虚拟空间、网站运营、企业网站设计、五大连池网站维护等服务，公司将坚持客户导向、应用为本的策略，正道将秉承"和谐、参与、激情"的文化，与客户和合作伙伴齐心协力一起成长，共同发展。

项目目标

爬取喜马拉雅音频数据

受害者地址

https://www.ximalaya.com/

本文知识点：

1、系统分析网页性质
2、多层数据解析
3、海量音频数据保存

环境：

python 3.6
pycharm
requests
parsel

思路：(爬虫案例)

1.确定数据所在的链接地址(url)
2.通过代码发送url地址的请求
3.解析数据(要的, 筛选不要的)
4.数据持久化(保存)

案例思路：

1. 在静态数据中获取音频的id值
2. 发送指定id值json数据请求(src)
3. 从json数据中解析音频所对应的URL地址

开始写代码

先导入所需的模块

import requests
import parsel  # 数据解析模块
import re

1.确定数据所在的链接地址(url) 逆向分析网页性质(静态网页/动态网页)

打开开发者工具，播放一个音频，在Madie里面可以找到一个数据包

Python怎么爬取喜马拉雅音频数据

复制URL，搜索

Python怎么爬取喜马拉雅音频数据

继续搜索，找到请求头参数

url = 'https://www.ximalaya.com/youshengshu/4256765/p{}/'.format(page)
headers = {
    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36'}

2.通过代码发送url地址的请求

response = requests.get(url=url, headers=headers)
html_data = response.text

3.解析数据(要的, 筛选不要的) 解析音频的 id值

selector = parsel.Selector(html_data)
lis = selector.xpath('//div[@class="sound-list _is"]/ul/li')

for li in lis:
    try:
        title = li.xpath('.//a/@title').get() + '.m4a'
        href = li.xpath('.//a/@href').get()
        # print(title, href)

        m4a_id = href.split('/')[-1]
        # print(href, m4a_id)

        # 发送指定id值json数据请求(src)
        json_url = 'https://www.ximalaya.com/revision/play/v1/audio?id={}&ptype=1'.format(m4a_id)
        json_data = requests.get(url=json_url, headers=headers).json()
        # print(json_data)

        # 提取音频地址
        m4a_url = json_data['data']['src']
        # print(m4a_url)

        # 请求音频数据
        m4a_data = requests.get(url=m4a_url, headers=headers).content

        new_title = change_title(title)

4.数据持久化(保存)

with open('video\\' + new_title, mode='wb') as f:
    f.write(m4a_data)
    print('保存完成:', title)

最后还要处理文件名非法字符

def change_title(title):
    pattern = re.compile(r"[\/\\\:\*\?\"\<\>\|]")  # '/ \ : * ? " < > |'
    new_title = re.sub(pattern, "_", title)  # 替换为下划线
    return new_title

完整代码

import re

import requests
import parsel  # 数据解析模块


def change_title(title):
    """处理文件名非法字符的方法"""
    pattern = re.compile(r"[\/\\\:\*\?\"\<\>\|]")  # '/ \ : * ? " < > |'
    new_title = re.sub(pattern, "_", title)  # 替换为下划线
    return new_title


for page in range(13, 33):
    print('---------------正在爬取第{}页的数据----------------'.format(page))
    # 1.确定数据所在的链接地址(url)  逆向分析  网页性质(静态网页/动态网页)
    url = 'https://www.ximalaya.com/youshengshu/4256765/p{}/'.format(page)
    headers = {
        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36'}

    # 2.通过代码发送url地址的请求
    response = requests.get(url=url, headers=headers)
    html_data = response.text
    # print(html_data)

    # 3.解析数据(要的, 筛选不要的)  解析音频的  id值
    selector = parsel.Selector(html_data)
    lis = selector.xpath('//div[@class="sound-list _is"]/ul/li')

    for li in lis:
        try:
            title = li.xpath('.//a/@title').get() + '.m4a'
            href = li.xpath('.//a/@href').get()
            # print(title, href)

            m4a_id = href.split('/')[-1]
            # print(href, m4a_id)

            # 发送指定id值json数据请求(src)
            json_url = 'https://www.ximalaya.com/revision/play/v1/audio?id={}&ptype=1'.format(m4a_id)
            json_data = requests.get(url=json_url, headers=headers).json()
            # print(json_data)

            # 提取音频地址
            m4a_url = json_data['data']['src']
            # print(m4a_url)

            # 请求音频数据
            m4a_data = requests.get(url=m4a_url, headers=headers).content

            new_title = change_title(title)
            # print(new_title)

            # 4.数据持久化(保存)
            with open('video\\' + new_title, mode='wb') as f:
                f.write(m4a_data)
                print('保存完成:', title)
        except:
            pass

运行代码，效果如下图

Python怎么爬取喜马拉雅音频数据

到此，相信大家对“Python怎么爬取喜马拉雅音频数据”有了更深的了解，不妨来实际操作一番吧！这里是创新互联网站，更多相关内容可以进入相关频道进行查询，关注我们，继续学习！

分享标题：Python怎么爬取喜马拉雅音频数据
URL地址：http://cdkjz.cn/article/pdegpj.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

Python怎么爬取喜马拉雅音频数据

项目目标

思路：(爬虫案例)

开始写代码

完整代码

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

Python怎么爬取喜马拉雅音频数据

项目目标

思路：(爬虫案例)

开始写代码

完整代码

相关资讯

厦门抖音餐饮运营公司电话厦门做短视频餐饮的有哪些

黄瓜短视频app推广码,泡芙短视频app推广码

短视频运营在哪边学好

短视频代运营有必要吗(短视频代运营内容)

新县本地短视频代运营

酒吧短视频运营方案（酒吧短视频运营方案怎么写）

周口短视频代运营服务

抖音短视频运营包含什么

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接