百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 热门文章 > 正文

Hive——常用知识点汇总01

bigegpt 2024-08-26 11:15 2 浏览

创建表

#1. 通过select数据集创建表
create table table_name [stored as orc]  
as
select  ......
#2. --只复制表结构,不复制表数据
CREATE TABLE empty_key_value_store LIKE key_value_store;

向表里加载数据

有local 是linux 本地 无local 是dhfs

LOAD DATA LOCAL INPATH '路径/文件名' OVERWRITE INTO TABLE 表名;
LOAD DATA LOCAL INPATH '路径/文件名' OVERWRITE INTO TABLE 表名 PARTITION(ds='2021-07-04');
insert into table ext_task1 partition(taskname='wordcount05') 
select
word,
num
from ext_task1
where taskname='wordcount0

导出数据到HDFS

有local 是linux 本地 无local 是hdfs

insert overwrite local directory '/home/user/' select NAME FROM USER;

注意:如果是分区表,导出数据时,导出的格式是avro、orc文件格式,如果不加分区导出时,会报错。

如何把分区表中所有数据都导出来avro、orc文件格式

需要通过临时表,作为中间表,先导出到中间表,再从中间表导出avro、orc文件格式的数据。

常规修改操作


--改表名
ALTER TABLE table_name RENAME TO new_table_name;
--修改表属性
ALTER TABLE table_name SET TBLPROPERTIES table_properties;
-- 增加表字段
alter table table_name add columns (test_col string);
--修改表字段
alter table ext_test_c CHANGE  COLUMN col_new col_new2 string;

对新增字段插入数据再查询发现是NULL

hive比较特殊的地方,在于它的表结构和数据其实是分开的。这个会导致,对hive分区表新增字段后,在执行插入分区的动作,会发现其实数据文件中已经有新字段值了,但是在查询的时候新字段的值还是显示为null。

例如我执行了下面的方法新增了一列col3:

alter table my.test_table add columns(col3 int comment '第三列')

然后想插入一些数据:

insert overwrite table my.test_table partition(pt=1) 
select 1 as col1, 2 as col2 ,3 as col3 from my.online_table; 

结果查询col1,col2,col3发现结果其实是:

1 2 NULL 1 2 NULL ...1

这是因为你对表结构进行了改变,但是历史分区的数据却没有做改变(新增分区不会出现这个情况)。

为了解决上面的问题,可以采用两种方式:

如果已经执行添加操作,并且没有带cascade,可以尝试下面的方法:

使用replace 恢复表结构,这样历史的分区数据都不会消失

使用replace 恢复表结构,这样历史的分区数据都不会消失
alter table industry_db.product replace
columns(product_name string comment ‘产品名’);
  • 在新增的时候加上cascade关键词
alter table my.test_table add columns(col3 int comment '第三列') cascade

Hive视图

  • 只有逻辑视图,没有物化视图;
  • 视图只能查询,不能Load/Insert/Update/Delete数据; alter view 和重建效果一致。
  • 视图在创建时候,只是保存了一份元数据,在hdfs中没有体现,当查询视图的时候,才开始执行视图对应的那些子查询,如果子查询比较简单,不会生成MapReduce任务;

结论: 无论 使用视图还是不使用视图,执行的任务数不变。主要是为了简化SQL的编写;

动态分区


在select最后一个字段必须跟你的分区字段,这样就会自行根据deptno的value来分区。

Hive默认是静态分区,我们在插入数据的时候要手动设置分区,如果源数据量很大的时候,那么针对一个分区就要写一个insert,比如说,有很多我们日志数据,我们要按日期作为分区字段,在插入数据的时候手动去添加分区,那样太麻烦。因此,Hive提供了动态分区,动态分区简化了我们插入数据时的繁琐操作。

--设置参数动态分区

--开启动态分区

set hive.exec.dynamic.partition=true;  

--这个属性默认是strict,即限制模式,strict是避免全分区字段是动态的,必须至少一个分区字段是指定有值即静态的,且必

--须放在最前面。设置为nonstrict之后所有的分区都可以是动态的了。

set hive.exec.dynamic.partition.mode=nonstrict;
--表示每个节点生成动态分区的最大个数,默认是100
set hive.exec.max.dynamic.partitions.pernode=10000;  

--表示一个DML操作可以创建的最大动态分区数,默认是1000
set hive.exec.max.dynamic.partitions=100000;

--表示一个DML操作可以创建的最大文件数,默认是100000
set hive.exec.max.created.files=150000

--将select数据,覆盖到表的动态分区
insert overwrite table table1 partition (ds, hr)  
select key, value, ds, hr FROM table2 WHERE ds is not null;

读到最后,希望对小伙伴有所帮助,希望多多点赞,多多转发。

相关推荐

Docker篇(二):Docker实战,命令解析

大家好,我是杰哥上周我们通过几个问题,让大家对于Docker有了一个全局的认识。然而,说跟练往往是两个概念。从学习的角度来说,理论知识的学习,往往只是第一步,只有经过实战,才能真正掌握一门技术所以,本...

docker学习笔记——安装和基本操作

今天学习了docker的基本知识,记录一下docker的安装步骤和基本命令(以CentOS7.x为例)一、安装docker的步骤:1.yuminstall-yyum-utils2.yum-con...

不可错过的Docker完整笔记(dockerhib)

简介一、Docker简介Docker是一个开源的应用容器引擎,基于Go语言并遵从Apache2.0协议开源。Docker可以让开发者打包他们的应用以及依赖包到一个轻量级、可移植的容器中,...

扔掉运营商的 IPTV 机顶盒,全屋全设备畅看 IPTV!

其实现在看电视节目的需求确实大大降低了,折腾也只是为了单纯的让它实现,享受这个过程带来的快乐而已,哈哈!预期构想家里所有设备直接接入网络随时接收并播放IPTV直播(电信点播的节目不是太多,但好在非常稳...

第五节 Docker 入门实践:从 Hello World 到容器操作

一、Docker容器基础运行(一)单次命令执行通过dockerrun命令可以直接在容器中执行指定命令,这是体验Docker最快捷的方式:#在ubuntu:15.10容器中执行ech...

替代Docker build的Buildah简单介绍

Buildah是用于通过较低级别的coreutils接口构建OCI兼容镜像的工具。与Podman相似,Buildah不依赖于Docker或CRI-O之类的守护程序,并且不需要root特权。Builda...

Docker 命令大全(docker命令大全记录表)

容器生命周期管理run-创建并启动一个新的容器。start/stop/restart-这些命令主要用于启动、停止和重启容器。kill-立即终止一个或多个正在运行的容器rm-于删除一个或...

docker常用指令及安装rabbitMQ(docker安装rabbitmq配置环境)

一、docker常用指令启动docker:systemctlstartdocker停止docker:systemctlstopdocker重启docker:systemctlrestart...

使用Docker快速部署Storm环境(docker部署confluence)

Storm的部署虽然不是特别麻烦,但是在生产环境中,为了提高部署效率,方便管理维护,使用Docker来统一管理部署是一个不错的选择。下面是我开源的一个新的项目,一个配置好了storm与mono环境的D...

Docker Desktop安装使用指南:零基础教程

在之前的文章中,我多次提到使用Docker来安装各类软件,尤其是开源软件应用。鉴于不少读者对此有需求,我决定专门制作一期关于Docker安装与使用的详细教程。我主要以Macbook(Mac平台)为例进...

Linux如何成功地离线安装docker(linux离线安装httpd)

系统环境:Redhat7.2和Centos7.4实测成功近期因项目需要用docker,所以记录一些相关知识,由于生产环境是不能直接连接互联网,尝试在linux中离线安装docker。步骤1.下载...

Docker 类面试题(常见问题)(docker面试题目)

Docker常见问题汇总镜像相关1、如何批量清理临时镜像文件?可以使用sudodockerrmi$(sudodockerimages-q-fdanging=true)命令2、如何查看...

面试官:你知道Dubbo怎么优雅上下线的吗?你:优雅上下线是啥?

最近无论是校招还是社招,都进行的如火如荼,我也承担了很多的面试工作,在一次面试过程中,和候选人聊了一些关于Dubbo的知识。Dubbo是一个比较著名的RPC框架,很多人对于他的一些网络通信、通信协议、...

【Docker 新手入门指南】第五章:Hello Word

适合人群:完全零基础新手|学习目标:30分钟掌握Docker核心操作一、准备工作:先确认是否安装成功打开终端(Windows用户用PowerShell或GitBash),输入:docker--...

松勤软件测试:详解Docker,如何用portainer管理Docker容器

镜像管理搜索镜像dockersearch镜像名称拉取镜像dockerpullname[:tag]列出镜像dockerimages删除镜像dockerrmiimage名称或id删除...