海量存储基座与离线数仓建设
课程背景
数据集成之后,需要稳定、可扩展的存储基座和规范的数仓体系。HDFS作为大数据生态的存储基石,其元数据管理、小文件治理是运维痛点;HBase提供面向海量并发随机读写的NoSQL能力;而离线数仓的建模理论(Kimball维度建模)与Hive SQL优化(尤其是数据倾斜)是数据开发者的核心竞争力。本课程系统讲解从分布式存储到数仓分层建模、再到SQL优化与HBase高性能设计的完整链路。
课程收益
深入理解HDFS NameNode元数据、Federation联邦架构及读写流程
掌握小文件治理方案(HAR、SequenceFile、Hive合并)
精通HBase LSM-Tree、RowKey散列设计、布隆过滤器及Compaction优化
掌握Kimball维度建模理论,能够独立设计ODS→DWD→DWS→ADS分层
熟练使用拉链表处理缓慢变化维(SCD)
掌握Hive列式存储(ORC/Parquet)、执行计划解读及数据倾斜终极解决方案
课程特色
存储深度解析:不只讲用法,深入原理(NameNode、LSM-Tree)
数仓实战:从理论到落地分层,配套真实通信话单案例
倾斜攻克:专门章节解决Join倾斜、Group By倾斜
调优导向:RowKey设计、Compaction合并风暴规避
课程对象
大数据开发工程师、数据仓库工程师
HBase/Hive运维与开发人员
希望系统学习数仓建模的数据分析师
前置知识:SQL基础,了解Hadoop基本概念。建议先修《课程一》或具备数据集成基础。
课程时长
7天(共49小时)
课程大纲
单元1:分布式存储基座(HDFS)(1.5天)
第1课:HDFS核心机制与高可用(0.75天)
章节1:NameNode元数据管理机制与Federation联邦架构
章节2:读写底层全流程追踪与机架感知策略
实践:模拟DataNode节点,追踪文件写入的Block分配
第2课:HDFS运维与治理(0.75天)
章节1:小文件产生机制及对NameNode内存的致命危害
章节2:企业级小文件合并与归档治理方案(HAR、SequenceFile、Hive合并)
实践:生成大量小文件,观察NameNode内存变化,执行合并操作
单元2:高并发海量NoSQL存储(HBase)(2天)
第1课:HBase架构与底层数据结构(1天)
章节1:LSM-Tree存储结构与HRegionServer寻址机制
章节2:WAL日志与MemStore刷盘机制
实践:手动触发Flush和Compaction,观察HFile生成
第2课:HBase建模与性能调优(1天)
章节1:RowKey散列设计原则(解决热点与数据倾斜)
章节2:布隆过滤器与Compaction合并风暴优化
实践:设计用户行为表的RowKey,测试预分区下的读写负载
单元3:规范化数仓建模(Kimball)(1.5天)
第1课:数仓建模理论体系(0.75天)
章节1:Inmon范式建模与Kimball维度建模对比
章节2:事实表设计(事务、周期快照、累积快照)与维度表设计
实践:针对电商订单场景设计事实表和维度表
第2课:企业级数仓分层落地(0.75天)
章节1:ODS、DWD、DWS、ADS的分层原则与规范
章节2:拉链表机制与缓慢变化维处理实战
实践:构建用户维度拉链表,实现SCD Type2
单元4:SQL化数据分析与调优(Hive)(2天)
第1课:Hive架构与执行流(1天)
章节1:MetaStore结构剖析与物理转化过程
章节2:列式存储格式(ORC/Parquet)与压缩算法对比
实践:对比同一份数据在TextFile、ORC、Parquet下的查询性能
第2课:数据倾斜诊断与终极化解(1天)
章节1:Hive SQL执行计划(Explain)关键指标解读
章节2:Join倾斜与Group By倾斜的底层成因与代码重写打散策略
实践:构造倾斜任务,使用加盐、MapJoin等方法解决
模块核心实验:亿级话单数据的存储与分层治理
将百GB级模拟通信话单导入HDFS,建立Hive数仓分层并抽取热点查询字段同步至HBase,验证RowKey散列设计对大并发查询的性能提升。
公司核心业务包括旅行式团建、培训式团建、主题式团建、策划式团建、体育式团建、户外式团建。起赢培训不断追求团建产品创新与服务超越,致力于打造成为中国最具影响力与创新力的团队建设品牌。
查看更多