百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 热门文章 > 正文

干货!Hive常用10大应用技巧

bigegpt 2024-08-16 14:26 2 浏览

推荐一个数据分析宝藏公众号「小火龙说数据」

无广告、无软文、纯干货,更多精彩原创文章与你分享!


01 Hive运行顺序

在应用Hive过程中,你是否有过这样的疑问?

「同层查询中,sum/avg聚合后的过滤是否可以放在where后面?」

针对类似问题,只要清楚了Hive SQL的运行顺序,便会迎刃而解,顺序如下:

(步骤7) SELECT count(*) as col1 (步骤8) DISTINCT
(步骤1) FROM
(步骤3) A JOIN B
(步骤2) ON A.x = B.x
(步骤4) WHERE A.y = 1
(步骤5) GROUP BY A.x
(步骤6) HAVING col1 > 100
(步骤9) ORDER BY col1
(步骤10) LIMIT 100

因此,针对上面的问题,由于group by是在where的后面,因此sum/avg聚合后的过滤是不可以放在where中的,而是需要放在having当中。


02 数据倾斜出现原因及解决方案

正所谓“不怕数据大,就怕发生数据倾斜”,数据倾斜是Hive经常遇到的问题,同时也是面试的高发问题。针对数据倾斜,小火龙为大家汇总了问题发生的情况,以及处理的方式,如下图:


03 过滤条件放置位置「join 场景」

Join场景中,过滤条件要放在左表和右表的子查询里面,而不要放置在join on外侧过滤。

不建议

Select 
  t1.x
  ,t2.x
from 
  qqq t1
left join 
  ppp t2
on 
  t1.key=t2.key 
  and t1.ds=d1 
  and t2.ds=d1
;

建议

Select 
  t1.x 
  ,t2.x 
from 
  (select * from a where ds=d1) t1
left join
  (select * from  b where ds=d1) t2 
on 
  t1.key=t2.key
;


04 AB两表放置位置「join场景」

内连接时小表放前面、大表放后面。将较大的表放在inner join操作符的右侧,可以提高查询效率,执行速度快,不容易出现计算内存溢出错误。

[A为小表]
A inner join B on A.key = B.key ;


05 hive与mysql/oracle差异「join场景」

内关联场景中,hive与mysql/oracle存在一些差异。

正确写法

A join B on A.key=B.key ;

错误写法

from A ,B where A.key=B.key ;

下面写法在mysql/oracle等价于内连接,但是在Hive中会导致笛卡尔积,查询无法运行。


06 分区缩小扫描范围「where场景」

有些同学在码SQL的时候,有时会忘记加分区筛选,这会导致全表扫描。不仅会影响自己的产出速度,还会占用过多资源,影响整个集群的使用。


07 distinct与group by的区别「计数场景」

在去重计数场景中,我们经常应用count(distinct)来进行处理;有时也会先在内层通过group by聚合,然后再在外层计数count(*)。那这两者的区别是什么呢?


「group by」适用于数据量级较大的情况

特点:时间复杂度高 + 空间复杂度低。

原理:group by先对列进行排序,类似sort方法,而排序的基本理论是,时间复杂度为nlog(n),空间复杂度为1。

优点:空间复杂度低,适用于大数据量级。


「distinct」适用于数据量级不大的情况

特点:时间复杂度低 + 空间复杂度高。

原理:distinct需要将col列中的全部内容都存储在一个内存中,可以理解为一个hash结构,key为col的值,最后计算hash结构中有多少个key即可得到结果。需要将所有不同值存储在一起,内存消耗较大。

优点:时间复杂度低,适用于中小数据量级。


08 order by与distribute by sort by的区别「排序场景」

在排序场景中,这两个函数使我们经常遇到的,这两者的区别在于:


「order by」

适用于全局排序,数据放在一个reduce中处理。


「distribute by sort by」

适用于分组排序及全局排序,数据放在多个reduce中处理。


09 union与union all的区别「merge场景」

当需要将多个数据源合并在一起的时候,会遇到union的情况。


「union」

合并过程中,数据集去重合并。例如:输入多相同行,输出保留一行。


「union all」

合并过程中,数据集全部合并。因此,union all支持并行执行。例如:输入多相同行,输出多相同行。


10 哪些场景提供加速查询「limit场景」

众所周知,Hive查询是基于MR执行的,但调用Map/Reduce是存在时间成本的。如果我们只需要取几条探查一下表数据,通常通过limit限制查询的条数,而当where中除分区外没有其他过滤条件时,是不会生成Map/Reduce,数据即可输出,提升效率。

limit不生成Map/Reduce场景(推荐使用)

Select * from A limit 10;
Select * from A where ds = 20121212 limit 10;

limit生成Map/Reduce场景

Select * from A where ds = 20220101 and guid=’xxx’ limit 10;
Select a from A limit 10;
Select a from A where ds = 20220101 limit 10;

以上就是本期的内容分享

如果你也对数据分析感兴趣,那就来关注我吧,更多「原创」文章,与你分享!!

微信公众号:小火龙说数据

相关推荐

了解Linux目录,那你就了解了一半的Linux系统

大到公司或者社群再小到个人要利用Linux来开发产品的人实在是多如牛毛,每个人都用自己的标准来配置文件或者设置目录,那么未来的Linux则就是一团乱麻,也对管理造成许多麻烦。后来,就有所谓的FHS(F...

Linux命令,这些操作要注意!(linux命令?)

刚玩Linux的人总觉得自己在演黑客电影,直到手滑输错命令把公司服务器删库,这才发现命令行根本不是随便乱用的,而是“生死簿”。今天直接上干货,告诉你哪些命令用好了封神!喜欢的一键三连,谢谢观众老爷!!...

Linux 命令速查手册:这 30 个高频指令,拯救 90% 的运维小白!

在Linux系统的世界里,命令行是强大的武器。对于运维小白而言,掌握一些高频使用的Linux命令,能极大提升工作效率,轻松应对各种系统管理任务。今天,就为大家奉上精心整理的30个Linu...

linux必学的60个命令(linux必学的20个命令)

以下是Linux必学的20个基础命令:1.cd:切换目录2.ls:列出文件和目录3.mkdir:创建目录4.rm:删除文件或目录5.cp:复制文件或目录6.mv:移动/重命名文件或目录7....

提高工作效率的--Linux常用命令,能够决解95%以上的问题

点击上方关注,第一时间接受干货转发,点赞,收藏,不如一次关注评论区第一条注意查看回复:Linux命令获取linux常用命令大全pdf+Linux命令行大全pdf为什么要学习Linux命令?1、因为Li...

15 个实用 Linux 命令(linux命令用法及举例)

Linux命令行是系统管理员、开发者和技术爱好者的强大工具。掌握实用命令不仅能提高效率,还能解锁Linux系统的无限潜力,本文将深入介绍15个实用Linux命令。ls-列出目录内容l...

Linux 常用命令集合(linux常用命令全集)

系统信息arch显示机器的处理器架构(1)uname-m显示机器的处理器架构(2)uname-r显示正在使用的内核版本dmidecode-q显示硬件系统部件-(SMBIOS/DM...

Linux的常用命令就是记不住,怎么办?

1.帮助命令1.1help命令#语法格式:命令--help#作用:查看某个命令的帮助信息#示例:#ls--help查看ls命令的帮助信息#netst...

Linux常用文件操作命令(linux常用文件操作命令有哪些)

ls命令在Linux维护工作中,经常使用ls这个命令,这是最基本的命令,来写几条常用的ls命令。先来查看一下使用的ls版本#ls--versionls(GNUcoreutils)8.4...

Linux 常用命令(linux常用命令)

日志排查类操作命令查看日志cat/var/log/messages、tail-fxxx.log搜索关键词grep"error"xxx.log多条件过滤`grep-E&#...

简单粗暴收藏版:Linux常用命令大汇总

号主:老杨丨11年资深网络工程师,更多网工提升干货,请关注公众号:网络工程师俱乐部下午好,我的网工朋友在Linux系统中,命令行界面(CLI)是管理员和开发人员最常用的工具之一。通过命令行,用户可...

「Linux」linux常用基本命令(linux常用基本命令和用法)

Linux中许多常用命令是必须掌握的,这里将我学linux入门时学的一些常用的基本命令分享给大家一下,希望可以帮助你们。总结送免费学习资料(包含视频、技术学习路线图谱、文档等)1、显示日期的指令:d...

Linux的常用命令就是记不住,怎么办?于是推出了这套教程

1.帮助命令1.1help命令#语法格式:命令--help#作用:查看某个命令的帮助信息#示例:#ls--help查看ls命令的帮助信息#netst...

Linux的30个常用命令汇总,运维大神必掌握技能!

以下是Linux系统中最常用的30个命令,精简版覆盖日常操作核心需求,适合快速掌握:一、文件/目录操作1.`ls`-列出目录内容`ls-l`(详细信息)|`ls-a`(显示隐藏文件)...

Linux/Unix 系统中非常常用的命令

Linux/Unix系统中非常常用的命令,它们是进行文件操作、文本处理、权限管理等任务的基础。下面是对这些命令的简要说明:**文件操作类:*****`ls`(list):**列出目录内容,显...