




资源介绍
视频数量:39个
总时长:3小时7分
课程介绍:
Delta Lake与Databricks数据工程实战
你有没有遇到过这样的场景:领导突然问你要三个月前的某份数据,你翻了半天发现表早就被覆盖了,历史版本一个字都没留下?又或者,业务部门临时改了字段格式,数据一下子写入失败,整个流水线卡在那里报错?这些让人头疼的问题,在数据工程师的日常工作中几乎是家常便饭。
这门课要解决的,就是这些真实场景中绕不开的难题。课程聚焦于Delta Lake和Databricks这两个现代数据工程领域的核心工具,通过八大模块、三十九个视频,总共大约三个小时的时间,带你从零开始建立起一套完整的数据处理思路。
一、认识现代数据平台的演进。
课程首先带你梳理数据平台的发展脉络。你会了解到从早期的Excel工作簿,到关系型数据库,再到数据仓库、数据湖,一直到如今火热的湖仓一体方案,这条技术演进路线背后的驱动力到底是什么。讲师会用Microsoft Fabric等常见工具举例,把抽象的概念拉回到你熟悉的工作场景中。同时,你会搞清楚数据湖、数据仓库、湖仓一体这三种架构各自适合什么场景,彼此之间有什么本质区别。搞清楚这些之后,再去理解Delta Lake的设计理念就会顺畅很多。这一模块最后会带你完成Delta Lake的环境搭建,为后面的动手实践做好准备。
二、用第一个项目练手——创建你的第一张Delta表。
动手环节从加载一份示例数据集开始。你会学到如何把数据导入Spark环境,如何创建一张Delta表,如何从中读取数据。更重要的是,你会亲手操作表的更新和删除记录,并验证表结构的变化。Delta表与普通Parquet文件最大的不同在于它支持ACID事务,这一节你会直观地感受到这一点。
三、搭建一条简单的数据清洗流水线。
真实世界的数据几乎没有干净的时候。讲师用一份合成的员工数据集做演示,里面有意埋了重复记录、缺失值和异常值。你会跟着讲师一步步操作:导入原始CSV数据,将其转为Delta格式,然后使用Spark内置函数识别并移除重复项,处理缺失值。学完这一节,你就掌握了ETL流程中转换这一环节的核心操作。
四、深入理解Schema约束与Schema演进。
数据写入时字段对不上怎么办?需要新增列时怎么处理?这一节专门解答这些问题。你会先学习如何用预定义Schema创建Delta表,然后测试当数据结构不一致时系统如何强制拦截。接下来,你会练习向已有表中添加新列,并在需要时启用Schema演进机制,最后验证更新后的表是否符合预期。这套机制在实际项目中极其重要,能帮你避免大量脏数据写入生产环境。
五、玩转Delta Lake的时间旅行功能。
这是Delta Lake最让人惊艳的特性之一。讲师会带你创建同一张表的多个版本,查看Delta表完整的历史记录,查询任意一个历史版本,甚至恢复被误删或被改错的数据。最后你还会学到如何对比不同版本之间的差异。做数据的同学都知道,误操作在所难免,有了这套时间机器,很多事故都能在几分钟内回滚。
六、搭建一个初级的Medallion架构。
这是课程中分量很重的一个项目。Medallion架构是数据工程领域非常流行的分层设计思路,将数据流分为三层:Bronze层存放原始数据,Silver层存放清洗后的数据,Gold层存放面向业务的高价值数据。你会跟着讲师从零搭建这套三层架构,把三层之间的数据流转串起来,并验证最终输出结果。搞懂了这个架构,你就掌握了现代数据平台的核心组织方式。
七、了解Databricks与AI在数据分析中的应用。
进入第七个模块,课程视角从Delta Lake扩展到整个Databricks平台。你会了解到Databricks平台的整体功能、Notebook的使用方式以及Genie等新工具。还会接触到如何在Databricks中构建数据流水线,以及人工智能如何融入数据分析流程。这些内容能帮你把视野从单一工具扩展到完整的平台生态。
八、课程总结与后续学习路径。
最后一节对整门课做一次完整的梳理,并给出一份Databricks学习路线图,告诉你在掌握本课程内容之后,下一步应该朝哪个方向继续深入。
这门课特别适合那些已经有一定Python或Spark基础,想要进入数据工程领域的同学。如果你是数据分析师,想要提升数据流水线的搭建能力,这门课也很合适。即使你之前完全没有接触过Databricks,只要跟着课程的节奏一步步走下来,也能建立起完整的数据工程知识体系。学完之后,你不仅能熟练操作Delta Lake的常用功能,还能独立搭建起符合Medallion架构的数据处理流水线,这在实际项目落地中是非常实用的能力。