hive查看存儲格式

發布時間: 2024-01-31 02:29:42

❶ hive存儲parquet表

parquet格式的表在生產環境中經常被使用到，具有列式存儲和壓縮等特點，我們怎麼在hive中存儲parquet格式的表呢。

這里使用oracle的emp表

載入本地數據到hive表

執行查詢

發現報錯

emp使用parquet格式存儲，其中imputFormat和outputFormat都是parquet的相關的，也前冊就是我的imputFormat是parquent的，但是你傳過來的是text，我不認識
我們看一下emp的相關信息,可以看到這里的都是parquet的format的，這是導致這次錯誤的原因。

這就導致了我們需要每次都先把text文件轉化為parquet的文件，然後parquent表進行載入才可以，下面介紹官方推薦的使用方法。

查看emp_tmp的表的信息,這里可以看到，默認的是TextImputFormat和TextOutputFormat的。

然後載入數據到emp_tmp,查看數據，是正常顯示的

然後現在把之前的emp裡面的數據給刪除

然後把emp_tmp表裡面的數據載入到emp

查詢一下，數據滑談正常顯示，這個方式使用起來還行，就是每次都需要對臨時表進行操作，還是比較麻煩的。

感覺這個問題是經常出現，為什麼會這樣呢。這個和hive的版本有一定的關系。

可以看出hive官方將inputformat和outputformat進行了整合，這樣使信悔碰用起來也是比較方便的。
但是可能有人想，那我修改inputformat不就行了，下面我介紹一下，看是否可以

創建emp2表,是parquet的存儲格式的

修改inputformat 和serde,這里inputFormat是TextInputFormat，SEDE使用的是LazySimpleSerDe，Outputformat任然是Parquet的，這里需要帶上。

查看emp2表的信息,如下圖表示修改成功

載入數據到emp2

查詢數據，執行成功

到這里，修改inputformat和serde的方法也介紹完成了，我們以為成功了，但是上hdfs上一看，文件還是txt格式的，所以通過修改inputformat和serde的方法不行。

肯定有人想使用這個方法
這個方法我也嘗試了，但是返回的值全都是null

在僅僅使用hive的時候，如果想把txt文件裡面的數據保存到parquet表裡面的話，可以使用建立臨時表的方法，這個方法也是比較好操作的。
但是其實如果使用spark，flink等分布式計算引擎的話，是可以直接的讀取txt數據保存到parquet表裡面的，框架幫我們做了轉化。這種方式也是我們在工作中經常使用的。
上面也介紹了修改inputformat和ser的方式，秀給inputformat是可以讓txt文件裡面的數據被讀進來的，如果同時還修改了serde為lazysimpleserde的話，這個是把數據保存為text格式的，已經完全和parquet沒有關系了，保存的文件還是txt格式的。僅修改inputformat，但是使用的serde是parquet的，但是數據進出不一致，也是有問題的。

❷ Hive優化之Hive的配置參數優化

Hive是大數據領域常用的組件之一，主要用於大數據離線數倉的運算，關於Hive的性能調優在日常工作和面試中是經常涉及的一個點，因此掌握一些Hive調優是必不可少的一項技能。影響Hive效率的主要因素有數據傾斜、數據冗餘、job的IO以及不同底層引擎配置情況和Hive本身參數和HiveSQL的執行等。本文主要從建表配置參數方面對Hive優化進行講解。

1. 創建一個普通表

table test_user1(id int, name string,code string,code_id string ) ROW FORMAT DELIMITED FIELDS TERMINATED BY ',';

2. 查看這張表的信息

DESCRIBE FORMATTED test_user1;

我們從該表的描述信息介紹建表時的一些可優化點。

2.1 表的文件數

numFiles表示表中含有的文件數，當文件數過多時可能意味著該表的小文件過多，這時候我們可以針對小文件的問題進行一些優化，HDFS本身提供了解決方案：

（1）Hadoop Archive/HAR：將小文件打包成大文件。

（2）SEQUENCEFILE格式：將大量小文件壓縮成一個SEQUENCEFILE文件。

（3）CombineFileInputFormat：在map和rece處理之前組合小文件。

（4）HDFS Federation：HDFS聯盟，使用多個namenode節點管理文件。

除此之外，我們還可以通過設置hive的參數來合並小文件。

（1）輸入階段合並

需要更改Hive的輸入文件格式，即參數hive.input.format，默認值是org.apache.hadoop.hive.ql.io.HiveInputFormat，我們改成org.apache.hadoop.hive.ql.io.CombineHiveInputFormat。這樣比起上面對mapper數的調整，會多出兩個參數，分別是mapred.min.split.size.per.node和mapred.min.split.size.per.rack，含義是單節點和單機架上的最小split大小。如果發現有split大小小於這兩個值（默認都是100MB），則會進行合並。具體邏輯可以參看Hive源碼中的對應類。

（2）輸出階段合並

直接將hive.merge.mapfiles和hive.merge.mapredfiles都設為true即可，前者表示將map-only任務的輸出合並，後者表示將map-rece任務的輸出合並，Hive會額外啟動一個mr作業將輸出的小文件合並成大文件。另外，hive.merge.size.per.task可以指定每個task輸出後合並文件大小的期望值，hive.merge.size.smallfiles.avgsize可以指定所有輸出文件大小的均值閾值，默認值都是1GB。如果平均大小不足的話，就會另外啟動一個任務來進行合並。

2.2 表的存儲格式

通過InputFormat和OutputFormat可以看出表的存儲格式是TEXT類型，Hive支持TEXTFILE, SEQUENCEFILE, AVRO, RCFILE, ORC,以及PARQUET文件格式，可以通過兩種方式指定表的文件格式：

（1）CREATE TABLE ... STORE AS <file_format>:在建表時指定文件格式，默認是TEXTFILE

（2）ALTER TABLE ... [PARTITION partition_spec] SET FILEFORMAT <file_format>:修改具體表的文件格式

如果要改變創建表的默認文件格式，可以使用set

hive.default.fileformat=<file_format>進行配置，適用於所有表。同時也可以使用set

hive.default.fileformat.managed = <file_format>進行配置，僅適用於內部表或外部表。

擴展：不同存儲方式的情況

TEXT,

SEQUENCE和

AVRO文件是面向行的文件存儲格式，不是最佳的文件格式，因為即便只查詢一列數據，使用這些存儲格式的表也需要讀取完整的一行數據。另一方面，面向列的存儲格式(RCFILE,

ORC, PARQUET)可以很好地解決上面的問題。關於每種文件格式的說明，如下：

（1）TEXTFILE

創建表時的默認文件格式，數據被存儲成文本格式。文本文件可以被分割和並行處理，也可以使用壓縮，比如GZip、LZO或者Snappy。然而大部分的壓縮文件不支持分割和並行處理，會造成一個作業只有一個mapper去處理數據，使用壓縮的文本文件要確保文件不要過大，一般接近兩個HDFS塊的大小。

（2）SEQUENCEFILE

key/value對的二進制存儲格式，sequence文件的優勢是比文本格式更好壓縮，sequence文件可以被壓縮成塊級別的記錄，塊級別的壓縮是一個很好的壓縮比例。如果使用塊壓縮，需要使用下面的配置：set

hive.exec.compress.output=true; set io.seqfile.compression.type=BLOCK

（3）AVRO

二進制格式文件，除此之外，avro也是一個序列化和反序列化的框架。avro提供了具體的數據schema。

（4）RCFILE

全稱是Record Columnar File，首先將表分為幾個行組，對每個行組內的數據進行按列存儲，每一列的數據都是分開存儲，即先水平劃分，再垂直劃分。

（5）ORC

全稱是Optimized Row Columnar，從hive0.11版本開始支持，ORC格式是RCFILE格式的一種優化的格式，提供了更大的默認塊(256M)

（6）PARQUET

另外一種列式存儲的文件格式，與ORC非常類似，與ORC相比，Parquet格式支持的生態更廣，比如低版本的impala不支持ORC格式。

配置同樣數據同樣欄位的兩張表，以常見的TEXT行存儲和ORC列存儲兩種存儲方式為例，對比執行速度。

TEXT存儲方式

總結：從上圖中可以看出列存儲在對指定列進行查詢時，速度更快，建議在建表時設置列存儲的存儲方式。

2.3 表的壓縮

對Hive表進行壓縮是常見的優化手段，一些存儲方式自帶壓縮選擇，比如SEQUENCEFILE支持三種壓縮選擇：NONE，RECORD，BLOCK。Record壓縮率低，一般建議使用BLOCK壓縮；

ORC支持三種壓縮選擇：NONE，ZLIB，SNAPPY。我們以TEXT存儲方式和ORC存儲方式為例，查看錶的壓縮情況。

配置同樣數據同樣欄位的四張表，一張TEXT存儲方式，另外三張分別是默認壓縮方式的ORC存儲、SNAPPY壓縮方式的ORC存儲和NONE壓縮方式的ORC存儲，查看在hdfs上的存儲情況：

TEXT存儲方式

默認壓縮ORC存儲方式

SNAPPY壓縮的ORC存儲方式

NONE壓縮的ORC存儲方式

總結：可以看到ORC存儲方式將數據存放為兩個block，默認壓縮大小加起來134.69M，SNAPPY壓縮大小加起來196.67M，NONE壓縮大小加起來247.55M，TEXT存儲方式的文件大小為366.58M，且默認block兩種存儲方式分別為256M和128M，ORC默認的壓縮方式比SNAPPY壓縮得到的文件還小，原因是ORZ默認的ZLIB壓縮方式採用的是deflate壓縮演算法，比Snappy壓縮演算法得到的壓縮比高，壓縮的文件更小。 ORC不同壓縮方式之間的執行速度，經過多次測試發現三種壓縮方式的執行速度差不多，所以建議採用ORC默認的存儲方式進行存儲數據。

2.4 分桶分區

Num Buckets表示桶的數量，我們可以通過分桶和分區操作對Hive表進行優化：

對於一張較大的表，可以將它設計成分區表，如果不設置成分區表，數據是全盤掃描的，設置成分區表後，查詢時只在指定的分區中進行數據掃描，提升查詢效率。要注意盡量避免多級分區，一般二級分區足夠使用。常見的分區欄位：

（1）日期或者時間，比如year、month、day或者hour，當表中存在時間或者日期欄位時，可以使用些欄位。

（2）地理位置，比如國家、省份、城市等

（3）業務邏輯，比如部門、銷售區域、客戶等等

與分區表類似，分桶表的組織方式是將HDFS上的一張大表文件分割成多個文件。分桶是相對分區進行更細粒度的劃分，分桶將整個數據內容按照分桶欄位屬性值得hash值進行區分，分桶可以加快數據采樣，也可以提升join的性能(join的欄位是分桶欄位)，因為分桶可以確保某個key對應的數據在一個特定的桶內(文件)，所以巧妙地選擇分桶欄位可以大幅度提升join的性能。通常情況下，分桶欄位可以選擇經常用在過濾操作或者join操作的欄位。

創建分桶表

create

table test_user_bucket(id int, name string,code string,code_id string )

clustered by(id) into 3 buckets ROW FORMAT DELIMITED FIELDS TERMINATED

BY ',';

查看描述信息

DESCRIBE FORMATTED test_user_bucket

多出了如下信息

查看該表的hdfs

同樣的數據查看普通表和分桶表查詢效率

普通表

分桶表

普通表是全表掃描，分桶表在按照分桶欄位的hash值分桶後，根據join欄位或者where過濾欄位在特定的桶中進行掃描，效率提升。

本文首發於：數棧研習社

數棧是雲原生—站式數據中台PaaS，我們在github上有一個有趣的開源項目： FlinkX

FlinkX是一個基於Flink的批流統一的數據同步工具，既可以採集靜態的數據，比如MySQL，HDFS等，也可以採集實時變化的數據，比如MySQL

binlog，Kafka等，是全域、異構、批流一體的數據同步引擎，大家如果有興趣，歡迎來github社區找我們玩~

❸ 【大數據-數倉】HIVE下的文件存儲遇到的一個問題（TEXTFILE、RCFILE）

問題：
Failed with exception Wrong file format. Please check the file's format.
FAILED: Execution Error, return code 1 from org.apache.hadoop.hive.ql.exec.MoveTask

解決：
當遇到這個肆激問題時，可以肯定一點的是，文件的格式和建表時指定的存儲格式是不一致的。
由此可以定位到問題出在納雹宴哪裡了。

1.確定數洞銀據源的格式：
一般都是txt/csv文件

2.確定建表時指定的存儲格式
show create table table_name;

然後查看：
STORED AS INPUTFORMAT #指定的存儲格式

3.重新建表並修改指定的存儲格式

❹ Hive支持的數據類型

#整型

TINYINT — 微整型，只佔用1個位元組，只能存儲0-255的整數。
SMALLINT– 小整型液賣，佔用2個位元組，存儲范圍–32768 到 32767。
INT– 整型，佔用4個位元組，存儲范圍-2147483648到2147483647。
BIGINT– 長整型，佔用8個位元組，存儲范圍-2^63到2^63-1。

#布爾型

BOOLEAN — TRUE/FALSE

#浮點型

FLOAT– 單精度浮點數。
DOUBLE– 雙精度浮點數。

#字元串型

STRING– 不設定長度。

Structs：一組由任意數據類型組成的結構。比如，定義一個欄位C的類型為STRUCT {a INT; b STRING}，則可以使用a和C.b來獲取其中的元素值；
Maps：和Java中的Map相同，即存儲K-V對的；
Arrays：數組；

復雜數據類型的聲明必須使用尖括弧指明其中數肢顫據欄位的類型。定義三列，每列對應一種復雜的數據類型，如下所示。

TEXTFILE //文本，默認值
SEQUENCEFILE // 二進制序列文件
RCFILE //列式存儲格式文件 Hive0.6以後開始支歷埋敗持
ORC //列式存儲格式文件，比RCFILE有更高的壓縮比和讀寫效率，Hive0.11以後開始支持
PARQUET //列出存儲格式文件，Hive0.13以後開始支持

#參考博客：

http://lxw1234.com/archives/2015/06/238.htm
http://www.cnblogs.com/zlslch/p/5659714.html
https://cwiki.apache.org/confluence/display/Hive/LanguageManual+Types

#

❺ hive的數據存儲

首先，Hive 沒有專門的數據存儲格式，也沒有為數據建立索引，用戶可以非常自由的組織 Hive 中的表，只需要在創建表的時候告訴 Hive 數據中的列分隔符和行分隔符，Hive 就可以解析數據。
其次，Hive 中所有的數據都存儲在 HDFS 中，Hive 中包含以下數據模型：表(Table)，外部表(External Table)，分區(Partition)，桶(Bucket)。
Hive 中的 Table 和資料庫中的 Table 在概念上是類似的，每一個 Table 在 Hive 中都有一個相應的目錄存儲數據。例如，一個表 pvs，它在 HDFS 中的路徑為：/wh/pvs，其中，wh 是在 hive-site.xml 中由 ${hive.metastore.warehouse.dir} 指定的數據倉庫的目錄，所有的 Table 數據（不包括 External Table）都保存在這個目錄中。
Partition 對應於資料庫中的 Partition 列的密集索引，但是 Hive 中 Partition 的組織方式和資料庫中的很不相同。在 Hive 中，表中的一個 Partition 對應於表下的一個目錄，所有的 Partition 的數據都存儲在對應的目錄中。例如：pvs 表中包含 ds 和 city 兩個 Partition，則對應於 ds = 20090801, ctry = US 的 HDFS 子目錄為：/wh/pvs/ds=20090801/ctry=US；對應於 ds = 20090801, ctry = CA 的 HDFS 子目錄為；/wh/pvs/ds=20090801/ctry=CA
Buckets 對指定列計算 hash，根據 hash 值切分數據，目的是為了並行，每一個 Bucket 對應一個文件。將 user 列分散至 32 個 bucket，首先對 user 列的值計算 hash，對應 hash 值為 0 的 HDFS 目錄為：/wh/pvs/ds=20090801/ctry=US/part-00000；hash 值為 20 的 HDFS 目錄為：/wh/pvs/ds=20090801/ctry=US/part-00020
External Table 指向已經在 HDFS 中存在的數據，可以創建 Partition。它和 Table 在元數據的組織上是相同的，而實際數據的存儲則有較大的差異。
Table 的創建過程和數據載入過程（這兩個過程可以在同一個語句中完成），在載入數據的過程中，實際數據會被移動到數據倉庫目錄中；之後對數據對訪問將會直接在數據倉庫目錄中完成。刪除表時，表中的數據和元數據將會被同時刪除。 External Table 只有一個過程，載入數據和創建表同時完成（CREATE EXTERNAL TABLE ……LOCATION），實際數據是存儲在 LOCATION 後面指定的 HDFS 路徑中，並不會移動到數據倉庫目錄中。當刪除一個 External Table 時，僅刪除元數據，表中的數據不會真正被刪除。

閱讀全文

熱點內容

java返回this 發布：2025-10-20 08:28:16 瀏覽：982

製作腳本網站發布：2025-10-20 08:17:34 瀏覽：1255

python中的init方法發布：2025-10-20 08:17:33 瀏覽：941

圖案密碼什麼意思發布：2025-10-20 08:16:56 瀏覽：1122

怎麼清理微信視頻緩存發布：2025-10-20 08:12:37 瀏覽：990

c語言編譯器怎麼看執行過程發布：2025-10-20 08:00:32 瀏覽：1344

郵箱如何填寫發信伺服器發布：2025-10-20 07:45:27 瀏覽：557

shell腳本入門案例發布：2025-10-20 07:44:45 瀏覽：452

怎麼上傳照片瀏覽上傳發布：2025-10-20 07:44:03 瀏覽：1121

python股票數據獲取發布：2025-10-20 07:39:44 瀏覽：1113

hive查看存儲格式

與hive查看存儲格式相關的資訊