网站建设 >

查看其它板块

Pyspark读取parquet数据过程的示例分析-创新互联

这篇文章主要介绍了Pyspark读取parquet数据过程的示例分析，具有一定借鉴价值，感兴趣的朋友可以参考下，希望大家阅读完这篇文章之后大有收获，下面让小编带着大家一起了解一下。

成都创新互联公司专注于常山企业网站建设,响应式网站建设,商城建设。常山网站建设公司,为常山等地区提供建站服务。全流程定制网站设计，专业设计，全程项目跟踪，成都创新互联公司专业和态度为您提供的服务

parquet数据：列式存储结构，由Twitter和Cloudera合作开发，相比于行式存储，其特点是：

可以跳过不符合条件的数据，只读取需要的数据，降低IO数据量；压缩编码可以降低磁盘存储空间，使用更高效的压缩编码节约存储空间；只读取需要的列，支持向量运算，能够获取更好的扫描性能。

那么我们怎么在pyspark中读取和使用parquet数据呢？我以local模式，linux下的pycharm执行作说明。

首先，导入库文件和配置环境：

import os
from pyspark import SparkContext, SparkConf
from pyspark.sql.session import SparkSession

os.environ["PYSPARK_PYTHON"]="/usr/bin/python3" #多个python版本时需要指定

conf = SparkConf().setAppName('test_parquet')
sc = SparkContext('local', 'test', conf=conf)
spark = SparkSession(sc)

然后，使用spark进行读取，得到DataFrame格式的数据：host:port 属于主机和端口号

parquetFile = r"hdfs://host:port/Felix_test/test_data.parquet"
df = spark.read.parquet(parquetFile)

而，DataFrame格式数据有一些方法可以使用，例如：

1.df.first() ：显示第一条数据，Row格式

print(df.first())

Pyspark读取parquet数据过程的示例分析

2.df.columns：列名

3.df.count()：数据量，数据条数

4.df.toPandas()：从spark的DataFrame格式数据转到Pandas数据结构

5.df.show()：直接显示表数据；其中df.show(n) 表示只显示前n行信息

6.type(df)：显数据示格式

Pyspark读取parquet数据过程的示例分析

感谢你能够认真阅读完这篇文章，希望小编分享的“Pyspark读取parquet数据过程的示例分析”这篇文章对大家有帮助，同时也希望大家多多支持创新互联，关注创新互联行业资讯频道，更多相关知识等着你来学习!

网站题目：Pyspark读取parquet数据过程的示例分析-创新互联
链接URL：http://cdkjz.cn/article/jeehc.html

返回首页了解更多建站资讯

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

大客户专线成都：13518219792 座机：028-86922220

在线咨询提交需求

友情链接交换友情链接

广安网站建设注册域名成都微商城开发成都网站SEO优化公司成都服务器租赁佑馨产后护理上市集团网站建设中国电信西部信息中心机房成都学生服定制成都网站设计公司

成都网站建设公司地址：成都市青羊区太升南路288号锦天国际A座10层建设咨询028-86922220

专家团队为您提供成都网站建设,成都网站设计,成都品牌网站设计,成都营销型网站制作等服务,成都建网站就找快上网！ | 成都网站建设哪家好？ | 网站建设地图

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

Pyspark读取parquet数据过程的示例分析-创新互联

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

Pyspark读取parquet数据过程的示例分析-创新互联

相关资讯

老域名有优势吗？老域名可以做什么？

2022年三款免费SSH客户端登录详情

买了域名后怎么建网站？新手对域名投资如何看？

哪些企业需要建网站？

免费ssl安全证书去哪申请?使用免费ssl证书有好处吗?

域名与商标有冲突如何处理？有什么解决方法？

网站上线前要做的事情新站应该做好哪些再上线

https和ssl是什么意思?他们之间有什么联系?

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接