大数据深度剖析
一套 10 篇的系列文章,讲解如何在 AWS 上构建现代数据平台 —— 存储、数据接入、查询引擎、编排与推荐系统。
10 篇
- 1
AWS 大数据深度剖析(第一部分):数据湖、数据仓库与湖仓一体革命
理解大数据的核心概念——数据湖 vs. 数据仓库 vs. 湖仓一体,OLTP vs. OLAP,以及为什么现代分析架构都在向 S3 收敛。
12 分钟 - 2
AWS 大数据深度剖析(第二部分):S3、Parquet 与 Apache Iceberg 详解
掌握现代数据湖的存储基石 —— S3 对象存储、Parquet 列式格式,以及 Iceberg 如何为 S3 上的文件加上 ACID 事务能力。
14 分钟 - 3
AWS 大数据深度剖析(第三部分):数据接入 —— DMS、Zero-ETL、Firehose 与 MSK
四类数据源,四条接入管道 —— 学习使用 DMS 做 CDC、Aurora Zero-ETL、MSK 上的 Kafka,以及 Firehose 微批处理,将数据落地到你的 S3 数据湖。
16 分钟 - 4
AWS 大数据深度剖析(第四部分):Glue Catalog、Athena 与 Lake Formation
AWS Glue Data Catalog 如何充当数据湖的中央目录,以及 Athena 如何用无服务器 SQL 查询 S3 上的 Parquet 与 Iceberg 表。
13 分钟 - 5
AWS 大数据深度解析(第五部分):EMR、Glue ETL、Flink 与管道编排
对比 EMR Serverless、Glue ETL、Managed Flink,选出合适的计算引擎;再用 MWAA(Airflow)与 Step Functions 编排数据管道。
14 分钟 - 6
AWS 大数据深度剖析(第 6 部分):端到端数据管道 —— 从数据源到特征存储
把所有环节串联起来:追踪一个点击事件如何从客户端 SDK 经过 API Gateway、MSK、Firehose、S3、数仓分层(ODS→DWD→DWS→ADS),最终写入 DynamoDB 用于实时服务。
10 分钟 - 7
AWS 大数据深度剖析(第 7 部分):推荐系统基础——漏斗、双塔与 PIT
理解推荐系统漏斗(召回 → 粗排 → 精排 → 重排)、双塔召回架构,以及为什么 Point-in-Time(时点)正确性对训练样本至关重要。
15 分钟 - 8
AWS 大数据深度剖析(第 8 部分):在线特征存储 —— DynamoDB、ElastiCache 与 OpenSearch k-NN
推荐系统如何在推理时提供特征服务:用 DynamoDB 存用户特征、用 ElastiCache 做热点缓存、用 OpenSearch k-NN 做向量召回、用 Neptune 做图检索。
13 分钟 - 9
AWS 大数据深度剖析(第九篇):SageMaker 与机器学习平台——从训练到生产
全面解析 SageMaker AI:Studio 笔记本、Feature Store、训练作业、实时 Endpoint、Model Monitor,以及它们如何融入推荐系统的 MLOps 工作流。
14 分钟 - 10
AWS 大数据深度解析(第 10 部分):完整架构蓝图与成本拆解
社交应用数据仓库与推荐系统在 AWS 上的完整端到端架构——每一个服务都一一对应,附带真实的月度成本估算与优化策略。
12 分钟