用python爬取公众号的方法-创新互联-快上网网站建设公司

用python爬取公众号的方法-创新互联

创新互联www.cdcxhl.cn八线动态BGP香港云服务器提供商，新人活动买多久送多久，划算不套路！

创新互联主营秦都网站建设的网络公司,主营网站建设方案,成都App定制开发,秦都h5小程序开发搭建,秦都网站营销推广欢迎秦都等地区企业咨询

这篇文章将为大家详细讲解有关用python爬取公众号的方法，小编觉得挺实用的，因此分享给大家做个参考，希望大家阅读完这篇文章后可以有所收获。

用python爬取公众号文章的方法是：1、使用Fiddler抓取公众号接口数据；2、使用Python脚本获取公众号所有历史文章数据；3、利用pdfkit库保存历史文章。

用python爬取公众号的方法

我比较喜欢看公众号，有时遇到一个感兴趣的公众号时，都会感觉相逢恨晚，想一口气看完所有历史文章。但是微信的阅读体验挺不好的，看历史文章得一页页的往后翻，下一次再看时还得重复操作，很是麻烦。

于是便想着能不能把某个公众号所有的文章都保存下来，这样就很方便自己阅读历史文章了。

话不多说，下面我就介绍如何使用 Python 爬取微信公众号所有文章的。

主要有以下步骤：

1 使用 Fiddler 抓取公众号接口数据

2 使用 Python 脚本获取公众号所有历史文章数据

3 保存历史文章

Fiddler 抓包

Fiddler 是一款抓包工具，可以监听网络通讯数据，开发测试过程中非常有用，这里不多做介绍。没有使用过的可以查看这篇文章，很容易上手。

https://blog.csdn.net/jingjingshizhu/article/details/80566191

接下来，使用微信桌面客户端，打开某个公众号的历史文章，这里以我的公众号举例，如下图。

如果你的 fiddler 配置好了的话，能够看到如下图的数据。

图中包含抓取的 url、一些重要的参数和我们想要的数据。

这些参数中，offset 控制着翻页，其他参数在每一页中都是固定不变的。

接口返回的数据结构如下图，其中 can_msg_continue 字段控制着能否翻页，1 表示还有下一页，0 表示没有已经是最后一页了。 next_offset 字段就是下一次请求的 offset 参数。

构造请求，获取数据

接下来我们的目标就是根据 url 和一些参数，构建请求，获取标题、文章 url 和日期等数据，保存数据。

保存数据一种是使用 pdfkit 将文章 url 保存为 pdf 文件；另一种是先保存 html 文件，然后将 html 制作成 chm 文件。

1 将文章 url 保存为 pdf 文件，关键代码如下：

def parse(index, biz, uin, key):
    # url前缀
    url = "https://mp.weixin.qq.com/mp/profile_ext"
    # 请求头
    headers = {
        "User-Agent": "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/39.0.2171.95 "
                      "Safari/537.36 MicroMessenger/6.5.2.501 NetType/WIFI WindowsWechat QBCore/3.43.901.400 "
                      "QQBrowser/9.0.2524.400",
    }
    proxies = {
        'https': None,
        'http': None,
    }
    # 重要参数
    param = {
        'action': 'getmsg',
        '__biz': biz,
        'f': 'json',
        'offset': index * 10,
        'count': '10',
        'is_ok': '1',
        'scene': '124',
        'uin': uin,
        'key': key,
        'wxtoken': '',
        'x5': '0',
    }
    # 发送请求，获取响应
    response = requests.get(url, headers=headers, params=param, proxies=proxies)
    response_dict = response.json()
    print(response_dict)
    next_offset = response_dict['next_offset']
    can_msg_continue = response_dict['can_msg_continue']
    general_msg_list = response_dict['general_msg_list']
    data_list = json.loads(general_msg_list)['list']
    # print(data_list)
    for data in data_list:
        try:
            # 文章发布时间
            datetime = data['comm_msg_info']['datetime']
            date = time.strftime('%Y-%m-%d', time.localtime(datetime))
            msg_info = data['app_msg_ext_info']
            # 文章标题
            title = msg_info['title']
            # 文章链接
            url = msg_info['content_url']
            # 自己定义存储路径（绝对路径）
            pdfkit.from_url(url, 'C:/Users/admin/Desktop/wechat_to_pdf/' + date + title + '.pdf')
            print(title + date + '成功')
        except:
            print("不是图文消息")
    if can_msg_continue == 1:
        return True
    else:
        print('爬取完毕')
        return False

2 保存 html 文件，关键代码如下

def parse(index, biz, uin, key):    # url前缀    url = "https://mp.weixin.qq.com/mp/profile_ext"    # 请求头    headers = {        "User-Agent": "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/39.0.2171.95 "                      "Safari/537.36 MicroMessenger/6.5.2.501 NetType/WIFI WindowsWechat QBCore/3.43.901.400 "                      "QQBrowser/9.0.2524.400",    }    proxies = {        'https': None,        'http': None,    }    # 重要参数    param = {        'action': 'getmsg',        '__biz': biz,        'f': 'json',        'offset': index * 10,        'count': '10',        'is_ok': '1',        'scene': '124',        'uin': uin,        'key': key,        'wxtoken': '',        'x5': '0',    }    # 发送请求，获取响应    reponse = requests.get(url, headers=headers, params=param, proxies=proxies)    reponse_dict = reponse.json()    # print(reponse_dict)    next_offset = reponse_dict['next_offset']    can_msg_continue = reponse_dict['can_msg_continue']    general_msg_list = reponse_dict['general_msg_list']    data_list = json.loads(general_msg_list)['list']    print(data_list)    for data in data_list:        try:            datetime = data['comm_msg_info']['datetime']            date = time.strftime('%Y-%m-%d', time.localtime(datetime))            msg_info = data['app_msg_ext_info']            # 标题            title = msg_info['title']            # 内容的url            url = msg_info['content_url'].replace("\\", "").replace("http", "https")            url = html.unescape(url)            print(url)            res = requests.get(url, headers=headers, proxies=proxies)            with open('C:/Users/admin/Desktop/test/' + title + '.html', 'wb+') as f:                f.write(res.content)            print(title + date + '成功')        except:            print("不是图文消息")    if can_msg_continue == 1:        return True    else:        print('全部获取完毕')        return False

网站标题：用python爬取公众号的方法-创新互联
URL网址：http://cdkjz.cn/article/cophes.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

用python爬取公众号的方法-创新互联

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

用python爬取公众号的方法-创新互联

相关资讯

linux查看白名单命令 linux查看黑名单

网件路由器网址 网件路由器登陆网址10001

阿里云服务器的防御 阿里云服务器安全防护

阿里云esc服务器搭建教程 阿里云服务器ecs建站教程

短作业优先代码Java 操作系统短作业优先算法代码

阿里云服务器sql2005连接不上 阿里云数据库连接

C语言字符分类函数 c语言各种字符

java电子小词典代码 java编程词典

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

网件路由器网址网件路由器登陆网址10001

阿里云服务器的防御阿里云服务器安全防护

阿里云esc服务器搭建教程阿里云服务器ecs建站教程

阿里云服务器sql2005连接不上阿里云数据库连接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接