【大数据处理与分析】数据仓库Hive:03 湖仓一体

发布时间:2026/9/21 22:32:16
【大数据处理与分析】数据仓库Hive:03 湖仓一体 【作者主页】Francek Chen【专栏介绍】⌈ ⌈⌈大数据技术原理与应用⌋ ⌋⌋专栏系统介绍大数据的相关知识分为大数据基础篇、大数据存储与管理篇、大数据处理与分析篇、大数据应用篇。内容包含大数据概述、大数据处理架构Hadoop、分布式文件系统HDFS、分布式数据库HBase、NoSQL数据库、云数据库、MapReduce、Hadoop再探讨、数据仓库Hive、Spark、流计算、Flink、图计算、数据可视化以及大数据在互联网领域、生物医学领域的应用和大数据的其他应用。【GitCode】专栏资源保存在我的GitCode仓库https://gitcode.com/Morse_Chen/BigData_principle_application。文章目录小结曾经数据仓库擅长的 BI、数据洞察离业务更近价值更大而数据湖里的数据更多的是为了远景“画饼”。而随着大数据和人工智能的普及原先的“画的饼”也变得炙手可热起来现在数据湖已经可以很好地为业务赋能它的价值正在被重新定义。因为数仓和数据库的出发点不同、架构不同企业在实际使用过程中“性价比”差异很大。如下页图所示数据湖起步成本很低但随着数据体量增大TCO总体成本成本会加速飙升数据仓库则恰恰相反前期建设开支很大。总之一个后期成本高一个前期成本高对于既想修湖、又想建仓的用户来说仿佛玩了一个金钱游戏。于是人们就想既然都是拿数据为业务服务数据湖和数据仓库作为两大“数据集散地”能不能彼此整合一下让数据流动起来少点重复建设呢比如让数据仓库在进行数据分析的时候可以直接访问数据湖里的数据Amazon Redshift Spectrum 就是这么做的。再比如让数据湖在架构设计上就“原生”支持数据仓库能力DeltaLake 就是这么做的。图1 数据湖和数据仓库的总体成本变化对比湖仓一体是一种新型的开放式架构打通了数据仓库和数据湖底层支持多种数据类型并存能实现数据间的相互共享上层可以通过统一封装的接口进行访问可同时支持实时查询和分析为企业进行数据治理带来了更多的便利性。“湖仓一体”架构最重要的一点是实现“湖里”和“仓里”的数据/元数据能够无缝打通并且“自由”流动。如图所示湖里的“新鲜”数据可以流到仓里甚至可以直接被数据仓库使用而仓里的“不新鲜”数据也可以流到湖里低成本长久保存供未来的数据挖掘使用。图2 数据湖和数据仓库之间的数据流动“湖仓一体”架构具有以下特性事务支持在企业中数据往往要为业务系统提供并发的读取和写入。对事务的 ACID 支持可确保数据并发访问的一致性、正确性尤其是在 SQL 的访问模式下。数据治理湖仓一体可以支持各类数据模型的实现和转变支持数据仓库模式架构例如星型模型、雪花模型等。可以保证数据完整性并且具有健全的治理和审计机制。BI 支持湖仓一体支持直接在源数据上使用 BI 工具这样可以加快分析效率降低数据延时。另外相比于在数据湖和数据仓库中分别操作两个副本的方式更具成本优势。存算分离存算分离的架构也使得系统能够扩展到更大规模的并发能力和数据容量。开放性采用开放、标准化的存储格式例如 Parquet 等提供丰富的 API 支持因此各种工具和引擎包括机器学习和 Python、R 等可以高效地对数据进行直接访问。支持多种数据类型结构化、半结构化、非结构化湖仓一体可为许多应用程序提供数据的入库、转换、分析和访问。数据类型包括图像、视频、音频、半结构化数据和文本等。小结湖仓一体打破数据湖与数仓的边界让“新鲜”数据可流入仓中即时分析“陈旧”数据可退回湖中低成本留存既避免重复建设又兼顾实时 BI 与长期挖掘。其核心在于元数据互通、存算分离、开放格式与 ACID 事务支持使结构化、半结构化及非结构化数据能统一治理并直接对接多种工具。这既缓解了湖后期成本飙升、仓前期投入大的两难也让数据价值从“画饼”变为可随时调用的资产真正实现降本增效与敏捷赋能。欢迎点赞 | 收藏⭐ | 评论✍ | 关注