大数据深度剖析

一套 10 篇的系列文章,讲解如何在 AWS 上构建现代数据平台 —— 存储、数据接入、查询引擎、编排与推荐系统。

10 篇

  1. 1

    AWS 大数据深度剖析(第一部分):数据湖、数据仓库与湖仓一体革命

    理解大数据的核心概念——数据湖 vs. 数据仓库 vs. 湖仓一体,OLTP vs. OLAP,以及为什么现代分析架构都在向 S3 收敛。

    12 分钟
  2. 2

    AWS 大数据深度剖析(第二部分):S3、Parquet 与 Apache Iceberg 详解

    掌握现代数据湖的存储基石 —— S3 对象存储、Parquet 列式格式,以及 Iceberg 如何为 S3 上的文件加上 ACID 事务能力。

    14 分钟
  3. 3

    AWS 大数据深度剖析(第三部分):数据接入 —— DMS、Zero-ETL、Firehose 与 MSK

    四类数据源,四条接入管道 —— 学习使用 DMS 做 CDC、Aurora Zero-ETL、MSK 上的 Kafka,以及 Firehose 微批处理,将数据落地到你的 S3 数据湖。

    16 分钟
  4. 4

    AWS 大数据深度剖析(第四部分):Glue Catalog、Athena 与 Lake Formation

    AWS Glue Data Catalog 如何充当数据湖的中央目录,以及 Athena 如何用无服务器 SQL 查询 S3 上的 Parquet 与 Iceberg 表。

    13 分钟
  5. 5

    AWS 大数据深度解析(第五部分):EMR、Glue ETL、Flink 与管道编排

    对比 EMR Serverless、Glue ETL、Managed Flink,选出合适的计算引擎;再用 MWAA(Airflow)与 Step Functions 编排数据管道。

    14 分钟
  6. 6

    AWS 大数据深度剖析(第 6 部分):端到端数据管道 —— 从数据源到特征存储

    把所有环节串联起来:追踪一个点击事件如何从客户端 SDK 经过 API Gateway、MSK、Firehose、S3、数仓分层(ODS→DWD→DWS→ADS),最终写入 DynamoDB 用于实时服务。

    10 分钟
  7. 7

    AWS 大数据深度剖析(第 7 部分):推荐系统基础——漏斗、双塔与 PIT

    理解推荐系统漏斗(召回 → 粗排 → 精排 → 重排)、双塔召回架构,以及为什么 Point-in-Time(时点)正确性对训练样本至关重要。

    15 分钟
  8. 8

    AWS 大数据深度剖析(第 8 部分):在线特征存储 —— DynamoDB、ElastiCache 与 OpenSearch k-NN

    推荐系统如何在推理时提供特征服务:用 DynamoDB 存用户特征、用 ElastiCache 做热点缓存、用 OpenSearch k-NN 做向量召回、用 Neptune 做图检索。

    13 分钟
  9. 9

    AWS 大数据深度剖析(第九篇):SageMaker 与机器学习平台——从训练到生产

    全面解析 SageMaker AI:Studio 笔记本、Feature Store、训练作业、实时 Endpoint、Model Monitor,以及它们如何融入推荐系统的 MLOps 工作流。

    14 分钟
  10. 10

    AWS 大数据深度解析(第 10 部分):完整架构蓝图与成本拆解

    社交应用数据仓库与推荐系统在 AWS 上的完整端到端架构——每一个服务都一一对应,附带真实的月度成本估算与优化策略。

    12 分钟