网站建设 >

查看其它板块

Python第一个爬虫，爬取当当网Top500本五星好评书籍

来啦，老弟

创新互联主营甘州网站建设的网络公司,主营网站建设方案,APP应用开发,甘州h5小程序开发搭建,甘州网站营销推广欢迎甘州等地区企业咨询

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

我们已经知道怎么使用

Requests]

进行各种请求骚操作

也知道了对服务器返回的数据如何使用

正则表达式

来过滤我们想要的内容

...

那么接下来

我们就使用 requests 和 re 来写一个爬虫

作为一个爱看书的你（说的跟真的似的）

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

怎么能发现好书呢？

所以我们

爬取当当网的前 500本好五星评书籍

怎么样？

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

接下来就是

学习 python 的正确姿势

请在电脑的陪同下

边看本文边练习

首先我们要对我们的目标网站进行分析

先摸清对方的底

我们才能战无不胜

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

打开这个书籍排行榜的地址

http://bang.dangdang.com/books/fivestars/01.00.00.00.00.00-recent30-0-0-1-1

我们可以看到是这样的一个网页

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

每一页显示 20 本书

当我们点击下一页的时候

你可以发现地址变了

http://bang.dangdang.com/books/fivestars/01.00.00.00.00.00-recent30-0-0-1-2

也就是我们翻到第几页的时候

链接地址的最后一个参数会跟着变

那么我们等会在 python 中可以用一个变量

来实现获取不同页数的内容

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

接着

用我们之前说的 Chrome 骚操作

来分析一下

我们要的内容是怎么请求的

以及

返回给我们的源代码是什么样的

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

可以看到

我们通过 GET 请求

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

我们的请求头

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

这是服务器返回来的数据

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

接着我们再来分析一下我们要抓取的关键信息

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

我们要的就是前 500 本书的

排名

书名

图片地址

作者

推荐指数

五星评分次数

价格

通过源码我们可以看到

这些信息被放在了

标签中

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

那么我们等会就可以使用

来进行过滤我们要的信息

一顿分析完了之后

接下来撸代码了

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

主要思路

使用 page 变量来实现翻页

我们使用 requests 请求当当网

然后将返回的 HTML 进行正则解析

由于我们暂时还没学到数据库

所以解析完之后就把内容存到文件中。学习过程中有不懂的可以加入我们的学习交流秋秋圈784中间758后面214，与你分享Python企业当下人才需求及怎么从零基础学习Python，和学习什么内容。相关学习视频资料、开发工具都有分享

def main(page):
   url = 'http://bang.dangdang.com/books/fivestars/01.00.00.00.00.00-recent30-0-0-1-' + str(page)
    html = request_dandan(url)
   items = parse_result(html) # 解析过滤我们想要的信息

   for item in items:
       write_item_to_file(item)

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

请求当当网

当我们请求成功之后

拿到源代码

def request_dandan(url):
   try:
       response = requests.get(url)
       if response.status_code == 200:
           return response.text
   except requests.RequestException:
       return None

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

拿到源代码了

就要对其解析

使用正则表达式获取我们想要的关键信息

获取到了之后我们封装一下数据

def parse_result(html):
   pattern = re.compile('.*?list_num.*?(\d+).

.*?.*?class="star">.*?class="tuijian">(.*?).*?class="publisher_info">.*?target="_blank">(.*?).*?class="biaosheng">.*?(.*?)

.*?

¥(.*?).*?',re.S) items = re.findall(pattern,html) for item in items: yield { 'range': item[0], 'iamge': item[1], 'title': item[2], 'recommend': item[3], 'author': item[4], 'times': item[5], 'price': item[6] }

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

打印一下看看结果

for item in items:
       print(item)

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

可以看到这样的数据

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

没毛病

现在我们获取的是第 1 页的数据

如何自动获取 25 页 500 条数据呢

来个 for 循环呗

if __name__ == "__main__":
   for i in range(1,26):
       main(i)

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

获取完 500 本书的数据之后

存到 book.txt 文件

def write_item_to_file(item):
   print('开始写入数据 ====> ' + str(item))
   with open('book.txt', 'a', encoding='UTF-8') as f:
       f.write(json.dumps(item, ensure_ascii=False) + '\n')
       f.close()

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

完成

项目跑起来，学习过程中有不懂的可以加入我们的学习交流秋秋圈784中间758后面214，与你分享Python企业当下人才需求及怎么从零基础学习Python，和学习什么内容。相关学习视频资料、开发工具都有分享

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

打开我们存储的 book.txt 看看

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

前 500 本书的数据就被我们拿到啦

Python第一个爬虫，爬取当当网 Top 500 本五星好评书籍

网页名称：Python第一个爬虫，爬取当当网Top500本五星好评书籍
当前URL：http://cdkjz.cn/article/goigsg.html

返回首页了解更多建站资讯

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

大客户专线成都：13518219792 座机：028-86922220

在线咨询提交需求

友情链接交换友情链接

成都网站设计简阳服务器托管官网SEO排名新都网站建设网创广告网络营销公司成都移动机房 ndjierui.cn 营销网站建设 tyjierui.cn

成都网站建设公司地址：成都市青羊区太升南路288号锦天国际A座10层建设咨询028-86922220

专家团队为您提供成都网站建设,成都网站设计,成都品牌网站设计,成都营销型网站制作等服务,成都建网站就找快上网！ | 成都网站建设哪家好？ | 网站建设地图

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

Python第一个爬虫，爬取当当网Top500本五星好评书籍

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

Python第一个爬虫，爬取当当网Top500本五星好评书籍

相关资讯

用户自定义的函数c语言 用户自定义的c语言变量名

linux的命令行 linux的命令行界面快捷键

关于sap系统epc项目转固的信息

阿里云轻量应用服务器续费 阿里云轻量级应用服务器购买

c语言主函数引用c文件 c语言怎么在主函数调用自定义函数

中文域名怎么获得 中文域名怎么用

php的数据库有下载的吗 php数据库软件

智能聊天一直在登录界面 chat怎么登陆

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

用户自定义的函数c语言用户自定义的c语言变量名

阿里云轻量应用服务器续费阿里云轻量级应用服务器购买

中文域名怎么获得中文域名怎么用

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接