C2-12-数据分析与大数据
资料口径说明:本章延续当前 AWS CLF-C02 学习项目既有规则,主要依据用户提供的 719 题题库、
chatGPT会话1.md、chatGPT会话2.md、cmd1.md与前序 C2 章节的结构整理。题库中的答案与评论用于识别高频考点、业务场景和易混项,不自动视为当前 AWS 官方结论。涉及会随时间变化的产品状态、考试范围与 Support 体系时,本章只沿用项目资料中已经明确记录的状态;正式考试前仍应再对照 AWS 当前官方页面。
1-本章目标
业务系统数据库解决的是“交易怎么正确完成”,但企业还会问:昨天有多少用户?、哪个国家转化率最高?、用户点击路径是什么?、一年的订单趋势如何?、PB 级数据如何分析?、如何直接对 S3 中的数据执行 SQL?、如何做 BI Dashboard?、实时流数据怎么接入?项目资料把 Analytics 主线整理为:
SQL over S3 → Athena
ETL / Catalog → Glue
Streaming → Kinesis
Big Data → EMR
Search / Logs → OpenSearch
Data Warehouse → Redshift
BI → QuickSight
2-OLTP-与-Analytics-不是同一种数据库需求
RDS / Aurora
→ 订单交易、库存更新
→ OLTP 思维
Redshift / Data Lake / Athena
→ 大规模聚合分析
→ Analytics / OLAP 思维
不要因为“都能 SQL”就认为它们定位相同。
3-★★★★-Amazon-Athena
正式名称: Amazon Athena;;;中文: Serverless 交互式查询服务
3.1-为什么需要它
数据已经以 CSV/JSON/Parquet 等形式放在 S3,如果只是想用 SQL 查询分析,不一定值得先搭一套数据库集群。
3.2-它是什么
Athena 是 Serverless 交互式查询服务,可直接使用 SQL 查询 S3 中的数据。
3.3-GlobalShop-场景
GlobalShop 把访问日志保存在 S3,分析师临时查询“昨天东京地区 5xx 请求数量”,可以用 Athena。
3.4-常见组合
S3 + Glue Data Catalog + Athena;Athena results → S3/BI tools。
3.5-容易混淆
Athena ≠ Redshift:Athena 直接查询 S3、按查询模式;Redshift 是数据仓库。
3.6-题库通常怎么考
query S3 using SQL、serverless interactive query → Athena。
4-★★★★-AWS-Glue
正式名称: AWS Glue;;;中文: Serverless 数据集成与 ETL 服务
4.1-为什么需要它
数据来自订单数据库、日志、S3、第三方系统,格式不同,需要发现 Schema、清洗、转换和准备后才能分析。
4.2-它是什么
Glue 是 Serverless Data Integration 服务,核心概念包括 Data Catalog、Crawler、ETL Job 等。
4.3-GlobalShop-场景
GlobalShop Crawler 识别 S3 数据结构,ETL Job 清洗点击流并转换为分析友好的格式,Catalog 给 Athena/其他分析服务使用。
4.4-常见组合
S3 → Glue Crawler/Catalog/ETL → Athena/Redshift。
4.5-容易混淆
Glue ≠ Athena。Glue 负责准备/整合数据;Athena 负责查询。
4.6-题库通常怎么考
discover/prepare/move/integrate data、ETL、Data Catalog → Glue。
5-★★★★-Amazon-Kinesis
正式名称: Amazon Kinesis;;;中文: 实时流数据处理服务家族
5.1-为什么需要它
点击流、IoT、日志等数据不是每天一次批量产生,而是每秒持续到达,需要 Streaming ingestion 和近实时处理。
5.2-它是什么
Kinesis 提供实时数据流采集与处理相关服务能力。CLF 重点理解 Streaming,而不是深入 shard 配置。
5.3-GlobalShop-场景
GlobalShop 用户每次点击产生 Event,经 Kinesis 持续写入实时处理或 S3 数据湖。
5.4-常见组合
App → Kinesis → Lambda/Analytics/S3;Streaming pipeline。
5.5-容易混淆
Kinesis ≠ SQS:Kinesis 是流式数据处理平台;SQS 是消息队列与任务解耦。
5.6-题库通常怎么考
real-time streaming data、clickstream、telemetry、log stream → Kinesis。
6-★★★-Amazon-EMR
正式名称: Amazon Elastic MapReduce;;;中文: 托管大数据处理平台
6.1-为什么需要它
大规模数据处理经常需要 Apache Spark、Hadoop 等生态,但企业不想从零搭建和维护完整大数据集群。
6.2-它是什么
EMR 是托管大数据平台,简化运行 Spark、Hadoop 等开源大数据框架。
6.3-GlobalShop-场景
GlobalShop 对多年历史日志执行大规模 Spark 特征计算或离线数据处理。
6.4-常见组合
S3 + EMR/Spark;EMR output → S3/Redshift。
6.5-容易混淆
EMR ≠ Glue:两者都可处理数据,但 EMR 更偏开源大数据框架与可控计算环境;Glue 更偏 Serverless 数据集成/ETL。
6.6-题库通常怎么考
Hadoop、Spark、big data frameworks、managed cluster platform → EMR。
7-★★★-Amazon-OpenSearch-Service
正式名称: Amazon OpenSearch Service;;;中文: 托管搜索与日志分析服务
7.1-为什么需要它
业务需要全文搜索、日志搜索、可观测性分析等倒排索引类场景,普通关系数据库并不是最自然方案。
7.2-它是什么
OpenSearch Service 提供托管 OpenSearch 集群/Serverless 形态,用于搜索、日志分析和相关分析场景。
7.3-GlobalShop-场景
GlobalShop 商品搜索索引或应用日志搜索可以进入 OpenSearch。
7.4-常见组合
App/Logs → OpenSearch → Dashboards。
7.5-容易混淆
OpenSearch ≠ CloudWatch:CloudWatch 是监控平台;OpenSearch 是搜索/分析引擎,两者可处理部分相邻日志场景但定位不同。
7.6-题库通常怎么考
full-text search、log analytics、search engine → OpenSearch。
8-★★★★-Amazon-Redshift
正式名称: Amazon Redshift;;;中文: 云数据仓库
8.1-为什么需要它
企业需要对 TB/PB 级结构化分析数据进行复杂聚合、BI 查询和数据仓库分析,而不是用生产 RDS 承担全部报表。
8.2-它是什么
Redshift 是 AWS 托管云数据仓库服务,用于大规模分析。项目题库中 Redshift 粗略曝光约 18 次。
8.3-GlobalShop-场景
GlobalShop 把清洗后的订单、客户、商品维度数据加载到 Redshift,支持经营分析。
8.4-常见组合
S3/Glue → Redshift → QuickSight。
8.5-容易混淆
Redshift ≠ RDS:RDS 偏 OLTP 关系数据库;Redshift 偏 OLAP/Data Warehouse。
8.6-题库通常怎么考
petabyte-scale data warehouse、complex analytics、BI warehouse → Redshift。
9-★★★-Amazon-QuickSight
正式名称: Amazon QuickSight;;;中文: Serverless BI 服务
9.1-为什么需要它
数据准备好以后,业务人员还需要 Dashboard、图表和交互式分析,而不是手写 SQL 看表格。
9.2-它是什么
QuickSight 是 AWS 的 BI(Business Intelligence)服务,用于可视化、Dashboard 和分析。
9.3-GlobalShop-场景
GlobalShop 运营团队查看 GMV、转化率、地区销售 Dashboard。
9.4-常见组合
Athena/Redshift/RDS 等 → QuickSight。
9.5-容易混淆
QuickSight 不是数据仓库;它是消费和可视化分析结果的 BI 层。
9.6-题库通常怎么考
dashboard、business intelligence、visualization → QuickSight。
10-★★★★-Data-Lake
Data Lake = 数据湖。核心思想:以可扩展、低成本方式集中保存大量原始和处理后的多类型数据,再由不同计算/分析工具读取。AWS 常见数据湖底座:S3。
Operational Systems
│
├── DB
├── Logs
├── Clickstream
└── IoT
│
▼
S3
Data Lake
│
┌──────┼────────┐
▼ ▼ ▼
Glue Athena EMR
│
Redshift
│
QuickSight
11-★★★-AWS-Lake-Formation
Lake Formation 帮助建立、管理和治理安全的数据湖,简化权限与数据目录治理。它不是 S3 的替代,而是在数据湖治理层提供能力。
12-Data-Warehouse-vs-Data-Lake
| Data Lake | Data Warehouse | |
|---|---|---|
| 常见 AWS | S3 + Lake Formation/Glue | Redshift |
| 数据 | 原始、多格式、结构化/半结构化 | 更结构化、面向分析模型 |
| 目标 | 灵活集中保存与多种分析 | 高性能分析、BI |
13-GlobalShop-数据链路
User Click
│
▼
Kinesis
│
▼
S3;Data Lake
│
Glue Catalog / ETL
│
┌─┴───────────────┐
▼ ▼
Athena Redshift
│
▼
QuickSight
14-高频选择表
| 需求 | 服务 |
|---|---|
| S3 上直接 SQL | Athena |
| ETL / Catalog | Glue |
| 实时流数据 | Kinesis |
| Hadoop / Spark | EMR |
| 搜索 / 日志分析 | OpenSearch |
| Data Warehouse | Redshift |
| BI Dashboard | QuickSight |
15-本章最后要形成的判断方式
不要把本章记成一串 AWS 产品名,而要形成下面的思考路径:
业务需求是什么?
↓
它属于哪一层问题?
↓
需要什么技术能力?
↓
哪些 AWS 服务提供这类能力?
↓
为什么某一个更贴合场景?
↓
其他相似服务为什么不合适?
真正稳定的考试能力不是“看到关键词就背答案”,而是能够从业务要求推导到技术能力,再从技术能力推导到 AWS 服务。
16-与后续章节的关系
C2 负责建立技术体系本身;完整业务架构组合会在 C3 中继续展开;719 道题的逐题选项解析放在 C4;频率排名与强化学习放在 C5;考前压缩复习放在 C6。