DataTalksClub/data-engineering-zoomcamp
GitHub: DataTalksClub/data-engineering-zoomcamp
一门免费的九周数据工程课程,通过从零搭建端到端数据 pipeline 帮助学员系统掌握数据工程核心技能与主流技术栈。
Stars: 43922 | Forks: 8642
数据工程 Zoomcamp:一门关于数据工程基础的免费 9 周课程
通过从零开始构建端到端数据 pipeline 来掌握数据工程基础。获得行业标准工具和最佳实践的实战经验。
加入 Slack • #course-data-engineering 频道 • Telegram 公告 • 课程播放列表 • 常见问题
## 快速链接 | 资源 | 链接 | |----------|------| | 课程资料 | [GitHub 仓库](https://github.com/DataTalksClub/data-engineering-zoomcamp) | | 视频讲座 | [YouTube 播放列表](https://www.youtube.com/playlist?list=PL3MmuxUbc_hJed7dXYoJw8DoCuVHhGEQb) | | 文档 | [Zoomcamp 后勤](https://datatalks.club/docs/courses/zoomcamp-logistics/) · [数据工程 Zoomcamp](https://datatalks.club/docs/courses/data-engineering-zoomcamp/) | | 课程平台(截止日期、作业) | [courses.datatalks.club](https://courses.datatalks.club/) | | Slack 频道 | [#course-data-engineering](https://app.slack.com/client/T01ATQK62F8/C01FABYF2RG) | | 公告 | [Telegram](https://t.me/dezoomcamp) | | 常见问题 | [常见问题文档](https://datatalks.club/faq/data-engineering-zoomcamp.html) | ## 关于本课程 这门免费的 9 周课程通过从零开始构建端到端数据 pipeline 来教授数据工程基础。它由结构化的模块、实战研讨会和一个最终项目组成,让你获得行业标准工具和最佳实践的实战经验。 ## 适合人群 本课程面向希望学习如何构建数据 pipeline 并使用现代数据工程技术栈的开发者、分析师和数据科学家。不需要具备先前的数据工程经验。 ## 前置条件 为了充分利用这门课程,你应该具备: - 基本的编程经验 - 熟悉 SQL - 具备 Python 经验(有帮助但不是必需的) 不需要具备先前的数据工程经验。 ## 如何参与本课程 有两种方式可以参与本课程:实时班和自学。 | | 实时班 | 自学 | |-|-|-| | 开始时间 | 2027 年 1 月 | 随时 | | 讲座 | 预先录制 | 预先录制 | | 作业 | 评分 | 可用但不评分 | | 排行榜 | ✅ 有 | ❌ 无 | | 同伴互评 | ✅ 有 | ❌ 无 | | 证书 | ✅ 有 | ❌ 无 | | 费用 | 免费 | 免费 | | 注册 | [在此注册](https://airtable.com/shr6oVXeQvSI5HuWD) | 直接开始学习! | 自学步骤: 1. 跟随 [GitHub](https://github.com/DataTalksClub/data-engineering-zoomcamp) 上的资料 2. 在 [Slack](https://datatalks.club/slack.html) 中提问并分享进度 3. 做作业(自我检查)并建立一个项目作为你的作品集 ## 教学大纲 ### [模块 1:容器化与 Infrastructure as Code](01-docker-terraform/) - GCP 简介 - Docker 和 Docker Compose - 使用 Docker 运行 PostgreSQL - 使用 Terraform 设置基础设施 - 作业 ### [模块 2:Workflow Orchestration](02-workflow-orchestration/) - Data Lakes 和 Workflow Orchestration - 使用 Kestra 进行 Workflow Orchestration - 作业 ### [研讨会 1:数据摄取](cohorts/2026/workshops/dlt.md) - API 读取和 pipeline 可扩展性 - 数据规范化和增量加载 - 作业 ### [模块 3:数据仓库](03-data-warehouse/) - BigQuery 简介 - 分区、聚簇和最佳实践 - BigQuery 中的机器学习 ### [模块 4:Analytics Engineering](04-analytics-engineering/) - Analytics Engineering 和数据建模 - 使用 DuckDB 和 BigQuery 的 dbt(数据构建工具) - 测试、文档和部署 ### [模块 5:数据平台](05-data-platforms/) - 使用 Bruin 构建端到端数据 pipeline - 数据摄取、转换和质量 - 部署到云端(BigQuery) ### [模块 6:批处理](06-batch/) - Apache Spark 简介 - DataFrame 和 SQL - GroupBy 和 Joins 的内部机制 ### [模块 7:流处理](07-streaming/) - Kafka 简介 - Kafka Streams 和 KSQL - 使用 Avro 进行 schema 管理 ## 最终项目 [最终项目](projects/) 将所有学到的概念应用于真实场景中,包括同伴互评和反馈过程。 ## 证书
答:是的。所有视频、资料和作业都是免费且开源的。 问:我需要具备先前的数据工程经验吗?
答:不需要。你只需要基本的编程经验和对 SQL 有一些了解。Python 会有帮助,但不是必需的。 问:“实时班”是什么意思?有直播课吗?
答:没有强制的直播课。所有讲座都是预先录制的。“实时”意味着有截止日期、评分作业、排行榜、同伴互评以及证书资格。 问:我可以自学吗,会获得证书吗?
答:可以,你可以随时开始。获得证书需要在实时班期间完成最终项目和同伴互评。 ## 关于 DataTalks.Club
DataTalks.Club 是一个全球性的数据爱好者在线社区。这是一个讨论数据、学习、分享知识、提问和回答问题以及互相支持的地方。
网站 • 加入 Slack 社区 • 时事通讯 • 即将举行的活动 • YouTube • GitHub • LinkedIn • X
DataTalks.Club 的所有活动主要在 [Slack](https://datatalks.club/slack.html) 上进行。我们在那里发布更新,并讨论数据的各个方面、职业问题等等。 在 DataTalks.Club,我们组织在线活动、社区活动和免费课程。你可以在 [DataTalks.Club 文档](https://datatalks.club/docs/general/) 中了解更多关于我们所做的事情。标签:ETL, JavaCC, 多线程, 大数据, 开源课程, 数据工程, 数据管道, 测试用例, 目录扫描, 请求拦截, 软件工程, 逆向工具
