如何使用Python快速打开一个百万行级别的超大Excel文件-创新互联-快上网网站建设公司

如何使用Python快速打开一个百万行级别的超大Excel文件-创新互联

小编给大家分享一下如何使用Python快速打开一个百万行级别的超大Excel文件，希望大家阅读完这篇文章之后都有所收获，下面让我们一起去探讨吧！

创新互联建站专注于利通网站建设服务及定制，我们拥有丰富的企业做网站经验。热诚为您提供利通营销型网站建设，利通网站制作、利通网页设计、利通网站官网定制、成都小程序开发服务，打造利通网络公司原创品牌,更为您提供利通网站排名全网营销落地服务。

有同学求助说，当他试图打开一个20M左右的excel文件时，无论是使用pandas的read_excel，还是直接使用xlrd或者openpyxl模块，速度都慢到无法忍受的程度，耗时大约1分钟左右。

真的会这样吗？第一感觉是，这位同学在使用openpyxl模块时没有设置只读模式。为便于测试，先用下面的代码生成一个一百万行数据的excel文件。

>>> from openpyxl import Workbook
>>> wb = Workbook()
>>> sh = wb.active
>>> sh.append(['id', '语文', '数学', '英语', '物理'])
>>> for i in range(1000000): # 写入100万行数据
	sh.append([i+1, 90, 100, 95, 99])

	
>>> wb.save(r'd:\bigxlsx.xlsx')
>>> import os
>>> os.path.getsize(r'd:\bigxlsx.xlsx') # 文件大小：20M字节
20230528

接下来定义了一个使用openpyxl模块打开文件的函数，分别考察关闭和开启只读模式的时间消耗。

>>> from openpyxl import load_workbook
>>> import time
>>> def read_xlsx(read_only):
	t0 = time.time()
	wb = load_workbook(r'd:\bigxlsx.xlsx', read_only=read_only)
	t1 = time.time()
	print(wb.sheetnames)
	print(sh.cell(row=1, column=1).value)
	print(sh.cell(row=100, column=3).value)
	print('耗时%0.3f秒钟'%(t1-t0))

	
>>> read_xlsx(True)
['Sheet']
id
100
耗时0.404秒钟
>>> read_xlsx(False)
['Sheet']
id
100
耗时67.817秒钟

运行测试，果然，不开启只读的话，真的需要1分多钟，而使用只读模式的话，则仅需0.4秒钟。

不过，也别高兴得太早，openpyxl模块并没有提供像pandas.read_excel()那样把全部数据读入一个数据结构的功能，只能定位到行、列或格子以后再读取数据。要想使用openpyxl模块把全部数据读入到数组或DataFrame中，需要遍历所有的行和列，这仍然是一个非常耗时的操作。

那么，pandas.read_excel()是否也支持只读模式呢？遗憾的是，read_excel()并没有类似read_only这样的参数。尽管read_excel()可以接受文件路径、文件对象、类文件对象，甚至是二进制数据，但即使将文件内容传入，read_excel()解析这100万行数据仍然需要大约80秒钟。下面的代码验证了这一点。

>>> import pandas as pd
>>> def read_excel_by_pandas():	
	with open(r'd:\bigxlsx.xlsx', 'rb') as fp:
		content = fp.read()
		t0 = time.time()
		df = pd.read_excel(content, engine='openpyxl')
		t1 = time.time()
	print(df.head())
	print(df.tail())
	print('耗时%0.3f秒钟'%(t1-t0))

	
>>> read_excel_by_pandas()
  id 语文  数学 英语 物理
0  1 90 100 95 99
1  2 90 100 95 99
2  3 90 100 95 99
3  4 90 100 95 99
4  5 90 100 95 99
       id 语文  数学 英语 物理
999995  999996 90 100 95 99
999996  999997 90 100 95 99
999997  999998 90 100 95 99
999998  999999 90 100 95 99
999999 1000000 90 100 95 99
耗时81.369秒钟

结论：处理超大的Excel文件时，使用openpyxl模块的只读模式，可以快速打开并取得指定格子的数据，但不要尝试将全部数据读入到自己定义的数据结构中，这将花费漫长的时间。对此，pandas也无能为力。

看完了这篇文章，相信你对“如何使用Python快速打开一个百万行级别的超大Excel文件”有了一定的了解，如果想了解更多相关知识，欢迎关注创新互联行业资讯频道，感谢各位的阅读！

分享文章：如何使用Python快速打开一个百万行级别的超大Excel文件-创新互联
文章URL：http://cdkjz.cn/article/dchioo.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

如何使用Python快速打开一个百万行级别的超大Excel文件-创新互联

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

如何使用Python快速打开一个百万行级别的超大Excel文件-创新互联

相关资讯

linux命令行装虚拟机 linux虚拟机如何安装

mysql怎么改密码配置 mysql更改密码语句

合肥ios越狱开发人员 苹果越狱开发者

linux破坏性操作命令 linux文件损坏

linuxip配置命令 linux配置ip的方法

css样式的优点功能 css样式的作用是什么

linux命令错误还原 linux 还原

jquery悬浮教程 jquery悬停事件

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

合肥ios越狱开发人员苹果越狱开发者

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接