Python爬虫设置代理IP的方法(爬虫技巧)-创新互联-快上网网站建设公司

Python爬虫设置代理IP的方法(爬虫技巧)-创新互联

在学习Python爬虫的时候，经常会遇见所要爬取的网站采取了反爬取技术，高强度、高效率地爬取网页信息常常会给网站服务器带来巨大压力，所以同一个IP反复爬取同一个网页，就很可能被封，这里讲述一个爬虫技巧，设置代理IP。

创新互联公司秉承实现全网价值营销的理念，以专业定制企业官网，网站设计制作、网站设计，小程序开发，网页设计制作，成都做手机网站，成都全网营销帮助传统企业实现“互联网+”转型升级专业定制企业官网,公司注重人才、技术和管理，汇聚了一批优秀的互联网技术人才,对客户都以感恩的心态奉献自己的专业和所长。

（一）配置环境

安装requests库
安装bs4库
安装lxml库

（二）代码展示

# IP地址取自国内髙匿代理IP网站：http://www.xicidaili.com/nn/
# 仅仅爬取首页IP地址就足够一般使用
from bs4 import BeautifulSoup
import requests
import random
def get_ip_list(url, headers):
  web_data = requests.get(url, headers=headers)
  soup = BeautifulSoup(web_data.text, 'lxml')
  ips = soup.find_all('tr')
  ip_list = []
  for i in range(1, len(ips)):
    ip_info = ips[i]
    tds = ip_info.find_all('td')
    ip_list.append(tds[1].text + ':' + tds[2].text)
  return ip_list
def get_random_ip(ip_list):
  proxy_list = []
  for ip in ip_list:
    proxy_list.append('http://' + ip)
  proxy_ip = random.choice(proxy_list)
  proxies = {'http': proxy_ip}
  return proxies
if __name__ == '__main__':
  url = 'http://www.xicidaili.com/nn/'
  headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/53.0.2785.143 Safari/537.36'
  }
  ip_list = get_ip_list(url, headers=headers)
  proxies = get_random_ip(ip_list)
  print(proxies)函数get_ip_list(url, headers)传入url和headers，最后返回一个IP列表，列表的元素类似42.84.226.65:8888格式，这个列表包括国内髙匿代理IP网站首页所有IP地址和端口。

另外有需要云服务器可以了解下创新互联scvps.cn，海内外云服务器15元起步，三天无理由+7*72小时售后在线，公司持有idc许可证，提供“云服务器、裸金属服务器、高防服务器、香港服务器、美国服务器、虚拟主机、免备案服务器”等云主机租用服务以及企业上云的综合解决方案，具有“安全稳定、简单易用、服务可用性高、性价比高”等特点与优势，专为企业上云打造定制，能够满足用户丰富、多元化的应用场景需求。

当前标题：Python爬虫设置代理IP的方法(爬虫技巧)-创新互联
当前路径：http://cdkjz.cn/article/gohsg.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

Python爬虫设置代理IP的方法(爬虫技巧)-创新互联

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

Python爬虫设置代理IP的方法(爬虫技巧)-创新互联

相关资讯

文件服务器安全设置 文件服务器安全策略

c语言的函数组包括 c语言的函数组包括哪些内容

腾讯云服务器配置单 腾讯云服务器s5

短视频领域名字怎么起的 短视频取名

阿里云服务器不能访问htto 阿里云服务器无法连接到远程计算机

帝国cms调用所属栏目 帝国cms相关文章调用

腾讯云部署服务器吗 腾讯云部署服务器吗安全吗

java如何减少校验代码 java实现验证码校验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

文件服务器安全设置文件服务器安全策略

腾讯云服务器配置单腾讯云服务器s5

短视频领域名字怎么起的短视频取名

帝国cms调用所属栏目帝国cms相关文章调用

腾讯云部署服务器吗腾讯云部署服务器吗安全吗

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接