Hive中分组Limit非UDF方案的示例分析-快上网网站建设公司

Hive中分组Limit非UDF方案的示例分析

小编给大家分享一下Hive中分组Limit非UDF方案的示例分析，相信大部分人都还不怎么了解，因此分享这篇文章给大家参考一下，希望大家阅读完这篇文章后大有收获，下面让我们一起去了解一下吧！

为繁峙等地区用户提供了全套网页设计制作服务，及繁峙网站建设行业解决方案。主营业务为网站设计、成都网站制作、繁峙网站设计，以传统方式定制建设网站，并提供域名空间备案等一条龙服务，秉承以专业、用心的态度为用户提供真诚的服务。我们深信只要达到每一位用户的要求，就会得到认可，从而选择与我们长期合作。这样，我们也可以走得更远！

描述： id (自增),type (aaa, bbb,ccc ,ddd),status(ok,error) 三个字段，每个type，筛选status='ok'的并且id最小的那一条记录。

MySQL:

create table having_test (id int(11), type varchar(50),status varchar(50));
mysql> select * from having_test;
+------+------+--------+
| id   | type | status |
+------+------+--------+
|    1 | aaa  | ok     |
|    2 | aaa  | error  |
|    3 | aaa  | ok     |
|    4 | bbb  | ok     |
|    5 | ccc  | error  |
|    6 | ccc  | ok     |
|    7 | ddd  | error  |
+------+------+--------+


mysql> select * from having_test where status='ok' group by type having min(id);
+------+------+--------+
| id   | type | status |
+------+------+--------+
|    1 | aaa  | ok     |
|    4 | bbb  | ok     |
|    6 | ccc  | ok     |
+------+------+--------+

mysql中很简单就实现了，先 group 然后having ，但是hive上不是完全支持sql语法的，在hive上会不会这么简单呢，答案是否定的。

HIVE 中：

create table tmp_wjk_having_test (id int,  type string, status string) ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' ;
load data local inpath '/tmp/load.csv' overwrite into table tmp_wjk_having_test;   

select * from tmp_wjk_having_test; 
1    aaa     ok                                                                                                                                        
2    aaa     error                                                                                                                                     
3    aaa     ok                                                                                                                                        
4    bbb     ok                                                                                                                                        
5    ccc     error                                                                                                                                    
6    ccc     ok                                                                                                                                        
7    ddd     error 

select * from tmp_wjk_having_test where status='ok' group by type having min(id);
FAILED: Error in semantic analysis: Line 1:73 Expression not in GROUP BY key 'id'  
# hive 不支持这种写法。还是要用子查询


select * from tmp_wjk_having_test t1 join (
    select min(id) id from tmp_wjk_having_test where status='ok' group by type) t2 
on t1.id=t2.id ; 
1     aaa     ok     1
4     bbb     ok     4
6     ccc     ok     6

子查询对于小数据集没有影响，但是应用到大数据上最好的是只过一边表，然后就拿出结果。所以还在想新的方案。

select *,min(id) ii from tmp_wjk_having_test where  status='ok'  group by type ;
aaa     1     1
bbb     4     4
ccc     6     6

这种方案可行。问题点：

1. 为什么min(id)的条件明明是写到了select 中非where ，但是确起到了筛选的作用？

2. 为什么明明是select * ，min(id) 但是最后是拿到了3列(type , id , min(id) )，如果写成 select type ,min(id) 就只拿到2列( type ,min(id) ) .

select type,min(id) ii from tmp_wjk_having_test where  status='ok'  group by type；
aaa     1
bbb     4
ccc     6

++++更新 2014.11.11

3、一般可行方案：

2列 : select type,min(id) ii from tmp_wjk_having_test where  status='ok'  group by type；
多列：select t1.* from having_test t1 join (select name,min(age) mm from having_test group by name ) t2 on t1.name = t2.name and t1.age=t2.mm ;

以上是“Hive中分组Limit非UDF方案的示例分析”这篇文章的所有内容，感谢各位的阅读！相信大家都有了一定的了解，希望分享的内容对大家有所帮助，如果还想学习更多知识，欢迎关注创新互联行业资讯频道！

文章题目：Hive中分组Limit非UDF方案的示例分析
标题路径：http://cdkjz.cn/article/jgpggs.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

Hive中分组Limit非UDF方案的示例分析

MySQL:

HIVE 中：

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

Hive中分组Limit非UDF方案的示例分析

MySQL:

HIVE 中：

相关资讯

怎么做个人主页,用html做个人主页代码

tenda路由器怎么设置密码，tenda路由器怎么设置密码

监控轮询设置，轮询监控是什么意思

如何加速浏览器图片显示,旋风加速浏览器二维码图片

电视怎么设置，怎么设置电视

一张截图怎么到下一页

哪里有免费建站，有没有真正免费的建站平台

设置tty，黑莓手机拨号设置中的tty模式是什么

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接