跳到主要内容

C2-12-数据分析与大数据

资料口径说明:本章延续当前 AWS CLF-C02 学习项目既有规则,主要依据用户提供的 719 题题库、chatGPT会话1.mdchatGPT会话2.mdcmd1.md 与前序 C2 章节的结构整理。题库中的答案与评论用于识别高频考点、业务场景和易混项,不自动视为当前 AWS 官方结论。涉及会随时间变化的产品状态、考试范围与 Support 体系时,本章只沿用项目资料中已经明确记录的状态;正式考试前仍应再对照 AWS 当前官方页面。

1-本章目标

业务系统数据库解决的是“交易怎么正确完成”,但企业还会问:昨天有多少用户?、哪个国家转化率最高?、用户点击路径是什么?、一年的订单趋势如何?、PB 级数据如何分析?、如何直接对 S3 中的数据执行 SQL?、如何做 BI Dashboard?、实时流数据怎么接入?项目资料把 Analytics 主线整理为:

SQL over S3 → Athena
ETL / Catalog → Glue
Streaming → Kinesis
Big Data → EMR
Search / Logs → OpenSearch
Data Warehouse → Redshift
BI → QuickSight

2-OLTP-与-Analytics-不是同一种数据库需求

RDS / Aurora
→ 订单交易、库存更新
→ OLTP 思维

Redshift / Data Lake / Athena
→ 大规模聚合分析
→ Analytics / OLAP 思维

不要因为“都能 SQL”就认为它们定位相同。

3-★★★★-Amazon-Athena

正式名称: Amazon Athena;;;中文: Serverless 交互式查询服务

3.1-为什么需要它

数据已经以 CSV/JSON/Parquet 等形式放在 S3,如果只是想用 SQL 查询分析,不一定值得先搭一套数据库集群。

3.2-它是什么

Athena 是 Serverless 交互式查询服务,可直接使用 SQL 查询 S3 中的数据。

3.3-GlobalShop-场景

GlobalShop 把访问日志保存在 S3,分析师临时查询“昨天东京地区 5xx 请求数量”,可以用 Athena。

3.4-常见组合

S3 + Glue Data Catalog + Athena;Athena results → S3/BI tools。

3.5-容易混淆

Athena ≠ Redshift:Athena 直接查询 S3、按查询模式;Redshift 是数据仓库。

3.6-题库通常怎么考

query S3 using SQL、serverless interactive query → Athena。

4-★★★★-AWS-Glue

正式名称: AWS Glue;;;中文: Serverless 数据集成与 ETL 服务

4.1-为什么需要它

数据来自订单数据库、日志、S3、第三方系统,格式不同,需要发现 Schema、清洗、转换和准备后才能分析。

4.2-它是什么

Glue 是 Serverless Data Integration 服务,核心概念包括 Data Catalog、Crawler、ETL Job 等。

4.3-GlobalShop-场景

GlobalShop Crawler 识别 S3 数据结构,ETL Job 清洗点击流并转换为分析友好的格式,Catalog 给 Athena/其他分析服务使用。

4.4-常见组合

S3 → Glue Crawler/Catalog/ETL → Athena/Redshift。

4.5-容易混淆

Glue ≠ Athena。Glue 负责准备/整合数据;Athena 负责查询。

4.6-题库通常怎么考

discover/prepare/move/integrate data、ETL、Data Catalog → Glue。

5-★★★★-Amazon-Kinesis

正式名称: Amazon Kinesis;;;中文: 实时流数据处理服务家族

5.1-为什么需要它

点击流、IoT、日志等数据不是每天一次批量产生,而是每秒持续到达,需要 Streaming ingestion 和近实时处理。

5.2-它是什么

Kinesis 提供实时数据流采集与处理相关服务能力。CLF 重点理解 Streaming,而不是深入 shard 配置。

5.3-GlobalShop-场景

GlobalShop 用户每次点击产生 Event,经 Kinesis 持续写入实时处理或 S3 数据湖。

5.4-常见组合

App → Kinesis → Lambda/Analytics/S3;Streaming pipeline。

5.5-容易混淆

Kinesis ≠ SQS:Kinesis 是流式数据处理平台;SQS 是消息队列与任务解耦。

5.6-题库通常怎么考

real-time streaming data、clickstream、telemetry、log stream → Kinesis。

6-★★★-Amazon-EMR

正式名称: Amazon Elastic MapReduce;;;中文: 托管大数据处理平台

6.1-为什么需要它

大规模数据处理经常需要 Apache Spark、Hadoop 等生态,但企业不想从零搭建和维护完整大数据集群。

6.2-它是什么

EMR 是托管大数据平台,简化运行 Spark、Hadoop 等开源大数据框架。

6.3-GlobalShop-场景

GlobalShop 对多年历史日志执行大规模 Spark 特征计算或离线数据处理。

6.4-常见组合

S3 + EMR/Spark;EMR output → S3/Redshift。

6.5-容易混淆

EMR ≠ Glue:两者都可处理数据,但 EMR 更偏开源大数据框架与可控计算环境;Glue 更偏 Serverless 数据集成/ETL。

6.6-题库通常怎么考

Hadoop、Spark、big data frameworks、managed cluster platform → EMR。

7-★★★-Amazon-OpenSearch-Service

正式名称: Amazon OpenSearch Service;;;中文: 托管搜索与日志分析服务

7.1-为什么需要它

业务需要全文搜索、日志搜索、可观测性分析等倒排索引类场景,普通关系数据库并不是最自然方案。

7.2-它是什么

OpenSearch Service 提供托管 OpenSearch 集群/Serverless 形态,用于搜索、日志分析和相关分析场景。

7.3-GlobalShop-场景

GlobalShop 商品搜索索引或应用日志搜索可以进入 OpenSearch。

7.4-常见组合

App/Logs → OpenSearch → Dashboards。

7.5-容易混淆

OpenSearch ≠ CloudWatch:CloudWatch 是监控平台;OpenSearch 是搜索/分析引擎,两者可处理部分相邻日志场景但定位不同。

7.6-题库通常怎么考

full-text search、log analytics、search engine → OpenSearch。

8-★★★★-Amazon-Redshift

正式名称: Amazon Redshift;;;中文: 云数据仓库

8.1-为什么需要它

企业需要对 TB/PB 级结构化分析数据进行复杂聚合、BI 查询和数据仓库分析,而不是用生产 RDS 承担全部报表。

8.2-它是什么

Redshift 是 AWS 托管云数据仓库服务,用于大规模分析。项目题库中 Redshift 粗略曝光约 18 次。

8.3-GlobalShop-场景

GlobalShop 把清洗后的订单、客户、商品维度数据加载到 Redshift,支持经营分析。

8.4-常见组合

S3/Glue → Redshift → QuickSight。

8.5-容易混淆

Redshift ≠ RDS:RDS 偏 OLTP 关系数据库;Redshift 偏 OLAP/Data Warehouse。

8.6-题库通常怎么考

petabyte-scale data warehouse、complex analytics、BI warehouse → Redshift。

9-★★★-Amazon-QuickSight

正式名称: Amazon QuickSight;;;中文: Serverless BI 服务

9.1-为什么需要它

数据准备好以后,业务人员还需要 Dashboard、图表和交互式分析,而不是手写 SQL 看表格。

9.2-它是什么

QuickSight 是 AWS 的 BI(Business Intelligence)服务,用于可视化、Dashboard 和分析。

9.3-GlobalShop-场景

GlobalShop 运营团队查看 GMV、转化率、地区销售 Dashboard。

9.4-常见组合

Athena/Redshift/RDS 等 → QuickSight。

9.5-容易混淆

QuickSight 不是数据仓库;它是消费和可视化分析结果的 BI 层。

9.6-题库通常怎么考

dashboard、business intelligence、visualization → QuickSight。

10-★★★★-Data-Lake

Data Lake = 数据湖。核心思想:以可扩展、低成本方式集中保存大量原始和处理后的多类型数据,再由不同计算/分析工具读取。AWS 常见数据湖底座:S3。

Operational Systems

├── DB
├── Logs
├── Clickstream
└── IoT


S3
Data Lake

┌──────┼────────┐
▼ ▼ ▼
Glue Athena EMR

Redshift

QuickSight

11-★★★-AWS-Lake-Formation

Lake Formation 帮助建立、管理和治理安全的数据湖,简化权限与数据目录治理。它不是 S3 的替代,而是在数据湖治理层提供能力。

12-Data-Warehouse-vs-Data-Lake

Data LakeData Warehouse
常见 AWSS3 + Lake Formation/GlueRedshift
数据原始、多格式、结构化/半结构化更结构化、面向分析模型
目标灵活集中保存与多种分析高性能分析、BI

13-GlobalShop-数据链路

User Click


Kinesis


S3;Data Lake

Glue Catalog / ETL

┌─┴───────────────┐
▼ ▼
Athena Redshift


QuickSight

14-高频选择表

需求服务
S3 上直接 SQLAthena
ETL / CatalogGlue
实时流数据Kinesis
Hadoop / SparkEMR
搜索 / 日志分析OpenSearch
Data WarehouseRedshift
BI DashboardQuickSight

15-本章最后要形成的判断方式

不要把本章记成一串 AWS 产品名,而要形成下面的思考路径:

业务需求是什么?

它属于哪一层问题?

需要什么技术能力?

哪些 AWS 服务提供这类能力?

为什么某一个更贴合场景?

其他相似服务为什么不合适?

真正稳定的考试能力不是“看到关键词就背答案”,而是能够从业务要求推导到技术能力,再从技术能力推导到 AWS 服务。


16-与后续章节的关系

C2 负责建立技术体系本身;完整业务架构组合会在 C3 中继续展开;719 道题的逐题选项解析放在 C4;频率排名与强化学习放在 C5;考前压缩复习放在 C6。