Scrapy爬虫项目运行和调试的小技巧是怎样的-创新互联-快上网网站建设公司

Scrapy爬虫项目运行和调试的小技巧是怎样的-创新互联

今天就跟大家聊聊有关Scrapy爬虫项目运行和调试的小技巧是怎样的，可能很多人都不太了解，为了让大家更加了解，小编给大家总结了以下内容，希望大家根据这篇文章可以有所收获。

成都创新互联专注于石城企业网站建设,响应式网站设计,电子商务商城网站建设。石城网站建设公司,为石城等地区提供建站服务。全流程按需网站制作，专业设计，全程项目跟踪，成都创新互联专业和态度为您提供的服务

关于Scrapy爬虫项目运行和调试的小技巧

设置网站robots.txt规则为False

一般的，我们在运用Scrapy框架抓取数据之前，需要提前到settings.py文件中，将“ROBOTSTXT_OBEY = True”改为ROBOTSTXT_OBEY = False。

在未改动之后settings.py文件中默认爬虫是遵守网站的robots.txt规则的，如下图所示。

Scrapy爬虫项目运行和调试的小技巧是怎样的

如果遵守robots.txt规则的话，那么爬取的结果会自动过滤掉很多我们想要的目标信息，因此有必要将该参数设置为False，如下图所示。

Scrapy爬虫项目运行和调试的小技巧是怎样的

设置好robots.txt规则之后，我们便可以抓到更多网页的信息。

利用Scrapy shell进行调试

通常我们要运行Scrapy爬虫程序的时候会在命令行中输入“scrapy crawl crawler_name”，细心的小伙伴应该知道上篇文章中创建的main.py文件也是可以提高调试效率的，不过这两种方法都是需要从头到尾运行Scrapy爬虫项目，每次都需要请求一次URL，效率十分低。运行过Scrapy爬虫项目的小伙伴都知道Scrapy运行的时候相对较慢，有时候因为网速不稳定，根部就无法动弹。针对每次都需要运行Scrapy爬虫的问题，这里介绍Scrapy shell调试方法给大家，可以事半功倍噢。

Scrapy给我们提供了一种shell模式，让我们可以在shell脚本之下获取整个URL对应的网页源码。在命令行中进行运行，其语法命令是“scrapy shell URL”，URL是指你需要抓取的网页网址或者链接，如下图所示。

Scrapy爬虫项目运行和调试的小技巧是怎样的

该命令代表的意思是对该URL进行调试，当命令执行之后，我们就已经获取到了该URL所对应的网页内容，之后我们就可以在该shell下进行调试，再也不用每次都执行Scrapy爬虫程序，发起URL请求了。

通过shell脚本这种方式可以极大的提高调试的效率，具体的调试方法同爬虫主体文件中的表达式语法一致。举个栗子，如下图所示。

Scrapy爬虫项目运行和调试的小技巧是怎样的

将两个Xpath表达式所对应的选择器放到scrapy shell调试的脚本下，我们可以很清楚的看到提取的目标信息，而且省去了每次运行Scrapy爬虫程序的重复步骤，提高了开发效率。这种方式在Scrapy爬虫过程中十分常用，而且也十分的实用，希望小伙伴们都可以掌握，并且积极主动的为自己所用。

看完上述内容，你们对Scrapy爬虫项目运行和调试的小技巧是怎样的有进一步的了解吗？如果还想了解更多知识或者相关内容，请关注创新互联-成都网站建设公司行业资讯频道，感谢大家的支持。

分享题目：Scrapy爬虫项目运行和调试的小技巧是怎样的-创新互联
文章来源：http://cdkjz.cn/article/jespi.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

Scrapy爬虫项目运行和调试的小技巧是怎样的-创新互联

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

Scrapy爬虫项目运行和调试的小技巧是怎样的-创新互联

相关资讯

vb点虐 读取下一行 vb按行读取文本

wps怎么改时间域名名字 wps修改时间

zblog网站搬迁教程 zblog用户中心

怎么改mysql源代码 mysql修改primary key

php有数据库有结构图 php常见数据结构

怎么看域名别人用过的 怎么看自己域名

php随机生成测试数据 php随机生成测试数据流程图

mysql效率怎么样 mysql提高效率

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

vb点虐读取下一行 vb按行读取文本

怎么看域名别人用过的怎么看自己域名

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接