使用Python怎么实现一个多线程爬虫功能-创新互联-快上网网站建设公司

使用Python怎么实现一个多线程爬虫功能-创新互联

本篇文章为大家展示了使用Python怎么实现一个多线程爬虫功能，内容简明扼要并且容易理解，绝对能使你眼前一亮，通过这篇文章的详细介绍希望你能有所收获。

创新互联公司坚持“要么做到，要么别承诺”的工作理念，服务领域包括：成都做网站、网站设计、外贸营销网站建设、企业官网、英文网站、手机端网站、网站推广等服务，满足客户于互联网时代的乌当网站设计、移动媒体设计的需求，帮助企业找到有效的互联网解决方案。努力成为您成熟可靠的网络建设合作伙伴！

所用到得库

import os
import requests
from bs4 import BeautifulSoup

功能

# 多线程程序需要用到的一些包
# 队列
from queue import Queue
from threading import Thread

环境配置

解释器 python3.6
编辑器 pycharm专业版激活码

多线程类代码

# 多线程类
class Download_Images(Thread):
  # 重写构造函数
  def __init__(self, queue, path):
    Thread.__init__(self)
    # 类属性
    self.queue = queue
    self.path = path
    if not os.path.exists(path):
      os.mkdir(path)
  def run(self) -> None:
    while True:
      # 图片资源的url链接地址
      url = self.queue.get()
      try:
        download_images(url, self.path)
      except:
        print('下载失败')
      finally:
        # 当爬虫程序执行完成/出错中断之后发送消息给线程 代表线程必须停止执行
        self.queue.task_done()

爬虫代码

# 爬虫代码
def download_images(url, path):
  headers = {
    'User-Agent':
      'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36'
  }
  response = requests.get(url, headers=headers)
  soup = BeautifulSoup(response.text, 'lxml')
  img_list = soup.find_all('img', class_='ui image lazy')
  for img in img_list:
    image_title = img['title']
    image_url = img['data-original']

    try:
      with open(path + image_title + os.path.splitext(image_url)[-1], 'wb') as f:
        image = requests.get(image_url, headers=headers).content
        print('正在保存图片:', image_title)
        f.write(image)
        print('保存成功:', image_title)
    except:
      pass

if __name__ == '__main__':
  _url = '/tupian/20230522/{page}.html&
  urls = [_url.format(page=page) for page in range(1, 201)]
  queue = Queue()
  path = './threading_images/'
  for x in range(10):
    worker = Download_Images(queue, path)
    worker.daemon = True
    worker.start()
  for url in urls:
    queue.put(url)
  queue.join()
  print('下载完成...')

上述内容就是使用Python怎么实现一个多线程爬虫功能，你们学到知识或技能了吗？如果还想学到更多技能或者丰富自己的知识储备，欢迎关注创新互联行业资讯频道。

网站名称：使用Python怎么实现一个多线程爬虫功能-创新互联
URL链接：http://cdkjz.cn/article/ddjcjp.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

使用Python怎么实现一个多线程爬虫功能-创新互联

所用到得库

功能

环境配置

多线程类代码

爬虫代码

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

使用Python怎么实现一个多线程爬虫功能-创新互联

所用到得库

功能

环境配置

多线程类代码

爬虫代码

相关资讯

哪些h5网站比较好，谁知道有什么好的html5网站吗急急

电商网站有哪些类型,c2c模式的电商平台有哪些

织梦系统网站,织梦net网站以自己的意愿编织美丽织锦

云服务器系统哪个好？云服务器如何识别真假？

excel怎么设置只读，怎么设excel为只读文件呀

tsm设置，斯沃数控中西门子828d设置零偏软键是灰色怎么激活在tsm

怎么创建网址卖虚拟物品的平台

mc设置出生点，mc怎么设置出生点

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接