团建活动专家

《全栈大数据平台架构与开发实战》

 

【课程背景】 随着电信运营商与大型企业数据体量向 PB 级迈进,业务对数据处理的时效性、平台的高可用性以及集群的资源利用率提出了极为严苛的要求。当前的企业级数据平台已全面演进至“流批一体”与“湖仓一体”架构。大型企业的 IT 运维与数据工程师不仅需要保障分布式集群的稳定运行,更需要具备跨越底层存储引擎、核心计算框架、数仓建模规范及全链路性能调优的复合型架构思维。

 

【课程收益】

1.掌握全局数据流转架构:从海量日志与业务数据采集,到高可用消息总线流转,建立完整的数据流拓扑认知。

2.精通底层存储与计算基座调优:深入理解 HDFS 高可用架构与 YARN 资源调度策略,具备定位底层物理节点瓶颈的能力。

3.掌握核心引擎深度性能调优:透彻理解 Hive 与 Spark 核心组件的执行计划,熟练解决数据倾斜、OOM 等严重阻碍集群性能的生产级痛点。

4.具备实时计算与极速分析能力:掌握 Flink 流处理状态管理与容错机制,熟练应用 ClickHouse/Doris 等 OLAP 引擎实现百亿级数据秒级响应。

5.建立企业级数据治理规范:掌握基于 Kimball 的维度建模方法论,熟练运用调度系统与元数据管理工具,实现全链路的 DataOps 落地。

 

【课程特色】

全链路贯穿:以数据生命周期(采集-存储-计算-分析-治理)为核心骨架,避免单一组件孤立讲解。

深潜核心算力:针对 Spark 和 Hadoop 生态进行底层机制剖析,直击大型企业运维排障的核心盲区。

真实痛点驱动:课程实验直接对标生产环境中的高并发、资源抢占、数据倾斜等极限场景。

 

【课程对象】

大型企业、运营商的 IT 运维工程师与系统管理员;

希望向全栈数据架构师转型的大数据开发工程师;

需要深入理解底层性能优化逻辑的 DBA 与数仓工程师。

 

【课程时长】 课程建议总时长为 30 天(约 240 课时)

 

【课程大纲】

模块一:全局视野与数据集成总线 [建议时长:5天]

单元 1:物理架构演进与协同调度 (2天)

第 1 课:企业级数据架构变迁

章节 1:传统 Hadoop 生态到 Lambda 与 Kappa 架构解析

章节 2:“流批一体”与“湖仓一体”的物理架构定义与边界

第 2 课:集群协同与资源调度 (Zookeeper & YARN)

章节 1:Zookeeper 选举机制、ZAB 协议与高可用脑裂防护

章节 2:YARN 架构状态机与 Capacity Scheduler 队列抢占调优

章节 3:前沿演进:从 YARN 调度向 Kubernetes (K8s) 容器化调度的迁移逻辑

单元 2:海量数据采集与异构同步 (1.5天)

第 1 课:日志与业务数据实时采集

章节 1:Flume 拓扑架构与断点续传机制配置

章节 2:基于 Canal/Debezium 的 MySQL Binlog 实时解析与 CDC 架构

第 2 课:异构数据源批处理同步

章节 1:DataX 与 Apache SeaTunnel 底层架构剖析

章节 2:离线同步中的网络限速、并发控制与脏数据容忍机制

单元 3:高并发流转总线 (Kafka) (1.5天)

第 1 课:Kafka 底层存储与网络模型

章节 1:Log 存储模型、PageCache 与零拷贝 (Zero-Copy) 技术

章节 2:ISR 副本机制与高可用保障

第 2 课:生产级运维与调优

章节 1:防止数据丢失、重复消费的端到端配置

章节 2:分区 (Partition) 倾斜处理与集群扩缩容实战

【模块核心实验】:构建跨节点高可用数据集成总线

配置 ZK 与 Kafka 集群,利用 Flume 收集 Nginx 日志并经 DataX 建立 MySQL 同步链路,验证节点宕机时的数据自动故障转移。

模块二:海量存储基座与离线数仓建设 [建议时长:7天]

单元 1:分布式存储基座 (HDFS) (1.5天)

第 1 课:HDFS 核心机制与高可用

章节 1:NameNode 元数据管理机制与 Federation 联邦架构

章节 2:读写底层全流程追踪与机架感知策略

第 2 课:HDFS 运维与治理

章节 1:小文件产生机制及对 NameNode 内存的致命危害

章节 2:企业级小文件合并与归档治理方案

单元 2:高并发海量 NoSQL 存储 (HBase) (2天)

第 1 课:HBase 架构与底层数据结构

章节 1:LSM-Tree 存储结构与 HRegionServer 寻址机制

章节 2:WAL 日志与 MemStore 刷盘机制

第 2 课:HBase 建模与性能调优

章节 1:RowKey 散列设计原则(解决热点与数据倾斜)

章节 2:布隆过滤器 (Bloom Filter) 与 Compaction 合并风暴优化

单元 3:规范化数仓建模 (Kimball) (1.5天)

第 1 课:数仓建模理论体系

章节 1:Inmon 范式建模与 Kimball 维度建模对比

章节 2:事实表设计(事务、周期快照、累积快照)与维度表设计

第 2 课:企业级数仓分层落地

章节 1:ODS、DWD、DWS、ADS 的分层原则与规范

章节 2:拉链表机制与缓慢变化维 (SCD) 处理实战

单元 4:SQL 化数据分析与调优 (Hive) (2天)

第 1 课:Hive 架构与执行流

章节 1:MetaStore 结构剖析与物理转化过程

章节 2:列式存储格式 (ORC/Parquet) 与压缩算法对比

第 2 课:数据倾斜诊断与终极化解

章节 1:Hive SQL 执行计划 (Explain) 关键指标解读

章节 2:Join 倾斜与 Group By 倾斜的底层成因与代码重写打散策略

【模块核心实验】:亿级话单数据的存储与分层治理

将百 GB 级模拟通信话单导入 HDFS,建立 Hive 数仓分层并抽取热点查询字段同步至 HBase,验证 RowKey 散列设计对大并发查询的性能提升。

模块三:新一代计算引擎深度调优 (Spark) [建议时长:7天]

单元 1:Spark Core 底层计算模型 (2天)

第 1 课:分布式数据集与容错

章节 1:RDD 弹性机制深度解析与 Lineage 血缘容错

章节 2:宽依赖与窄依赖的物理意义

第 2 课:任务调度与执行物理拓扑

章节 1:从逻辑 DAG 到物理 Stage 的切分规则

章节 2:Shuffle 机制的演进历程与底层的磁盘 I/O 消耗

单元 2:Spark SQL 核心解析与优化 (2.5天)

第 1 课:Catalyst 优化器原理

章节 1:RBO (基于规则) 与 CBO (基于代价) 的逻辑计划重写

章节 2:钨丝计划 (Tungsten) 对 CPU 与内存的高效利用

第 2 课:Spark 核心性能调优手段

章节 1:Broadcast Hash Join 在大宽表生成中的强制应用

章节 2:Salting (加盐) 机制彻底解决 Spark Shuffle 数据倾斜

单元 3:Spark 集群运维与排障实战 (2.5天)

第 1 课:内存模型与 OOM 定位

章节 1:统一内存管理模型:Execution 与 Storage 的动态分配边界

章节 2:Executor OOM 与 Driver OOM 的典型诱因与排查链路

第 2 课:企业级配置调优

章节 1:数据本地化 (Data Locality) 级别分析与网络传输压降

章节 2:推测执行 (Speculative Execution) 应对长尾 Task

【模块核心实验】:Spark JVM 内存极限调优与防 OOM 压测

在集群中提交严重倾斜且消耗大内存的 Spark 任务,通过抓取 Heap Dump 定位 OOM 源头,调整 Executor 内存参数、堆外内存与 GC 策略,使失败任务平稳跑通。

模块四:实时计算与极速分析架构 [建议时长:7天]

单元 1:流批一体引擎核心机制 (Flink) (3天)

第 1 课:Flink 运行时架构

章节 1:分布式执行图 (ExecutionGraph) 与 Task Slot 资源隔离

章节 2:反压 (Backpressure) 的产生机制与网络缓冲排障

第 2 课:状态管理与时间语义

章节 1:State 状态后端 (RocksDB) 内存模型与大状态调优

章节 2:Checkpoint 容错屏障机制与全局一致性保障

章节 3:Window 窗口切分与 Watermark 乱序事件处理

第 3 课:实时数仓实战

章节 1:Flink SQL 在 Kafka 数据源上的 CDC 消费与双流 Join

章节 2:端到端 (Kafka-Flink-Sink) Exactly-Once 语义的实现

单元 2:极速分析与联邦查询引擎 (4天)

第 1 课:极速 OLAP 引擎 (ClickHouse/Doris)

章节 1:列式存储的物理块结构与向量化执行引擎

章节 2:MergeTree/Aggregate 引擎机制与稀疏索引原理

章节 3:大宽表高并发查询优化与物化视图应用

第 2 课:联邦查询引擎 (Presto/Trino)

章节 1:MPP 架构解析与内存计算管道 (Pipeline) 模型

章节 2:跨数据源(Hive + MySQL + Elasticsearch)的联合查询配置

第 3 课:全文检索与日志分析 (Elasticsearch)

章节 1:倒排索引结构与 Lucene 底层机制

章节 2:分片 (Shard) 与副本 (Replica) 路由策略及脑裂预防

【模块核心实验】:多引擎协同的实时大屏与跨源分析

利用 Flink 读取 Kafka 实时流进行状态聚合写入 ClickHouse 提供大屏秒级响应;同时使用 Trino 构建联邦查询,在一条 SQL 中联合 ClickHouse 的实时数据与 Hive 的离线历史数据。

模块五:数据治理、调度与前沿湖仓 [建议时长:4天]

单元 1:全链路调度与治理体系 (2天)

第 1 课:复杂工作流编排

章节 1:DolphinScheduler/Airflow 在数仓流水线中的依赖规划

章节 2:任务容错、重试机制与跨物理资源池的调度策略

第 2 课:数据资产与质量监控 (DataOps)

章节 1:Apache Atlas 数据血缘追踪在排障与下线评估中的应用

章节 2:数据质量中心 (DQC) 的规则制定与熔断拦截机制

单元 2:湖仓一体架构前沿 (Iceberg/Hudi) (2天)

第 1 课:数据湖底层机制

章节 1:Data Lake 的核心诉求与底层元数据组织格式 (Snapshot/Manifest)

章节 2:流批融合场景下的 ACID 事务支持与行级更新 (Upsert)

第 2 课:前沿场景闭环推演

章节 1:Schema Evolution(表结构演进)与 Time Travel(时间旅行查询)机制

章节 2:基于 Flink + Iceberg + Trino 构建完整的湖仓一体实时链路

【模块核心实验】:基于 Airflow 与 Atlas 的全生命周期审计

编写 DAG 编排从数据集成、Hive 离线处理到结果导出的全流程。引入异常数据触发 DQC 熔断,并通过 Atlas 血缘图谱逆向定位上游出错的计算节点。

 


关于我们

      公司核心业务包括旅行式团建、培训式团建、主题式团建、策划式团建、体育式团建、户外式团建。起赢培训不断追求团建产品创新与服务超越,致力于打造成为中国最具影响力与创新力的团队建设品牌。

查看更多

联系我们

底部图文