DEA-C01 题库 · 最新 50 题免费预览(第 2/5 页)
DEA-C01(AWS Certified Data Engineer Associate (DEA-C01))最新题库第 11–20 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 306 题。
第 11 题 · 题号 267 · 单选
一家全球金融公司需要在美国东部1区、欧洲西部2区和亚太东北1区的交易中心之间实施交易数据的近实时跨区域同步。该公司必须确保数据在传输过程中加密。解决方案必须确保数据顺序和一致性,并必须支持跨区域灾难恢复。解决方案必须提供低于500毫秒的数据延迟。哪种解决方案将以最少的运维工作量满足这些要求?
- A. 在每个 AWS 区域部署 Apache Kafka Connect。使用自定义开发的连接器来设置跨区域数据复制。配置 SSL 安全协议。
- B. 使用 Amazon Managed Streaming for Apache Kafka(Amazon MSK)复制器在三个 AWS 区域的 MSK 集群之间建立完全互联的复制关系。启用 TLS 加密和 IAM 身份验证。设置跨区域备份配置。
- C. 在每个 AWS 区域部署 Apache Kafka Mirror Maker 2.0。设置自定义复制策略以处理跨区域数据同步。配置 SSL 安全协议。
- D. 使用 Amazon Kinesis Data Streams 从每个 AWS 区域接收交易数据。使用 Amazon Data Firehose 在每个区域的 Amazon Managed Streaming for Apache Kafka(Amazon MSK)集群之间复制数据。配置 AWS Key Management Service(AWS KMS)加密和 IAM 角色以管理访问权限。
答案: B
解析: 选项B是最佳选择,因为Amazon MSK Replicator是一项完全托管的服务,可以以最小的运营工作量处理MSK集群之间的跨区域复制。它自动处理数据排序和一致性,并提供TLS加密和IAM身份验证。“完全互连的复制”功能支持灾难恢复要求,作为托管服务,与自行管理Apache Kafka Connect(选项A)或MirrorMaker 2.0(选项C)相比,它所需的运营开销显著降低。选项D过于复杂,将Kinesis Data Streams和Firehose与MSK集群混合使用,增加了运营复杂性。
第 12 题 · 题号 268 · 单选
一家大公司的数据工程师需要创建针对 Amazon Redshift 性能进行优化的集中化数据集。该公司有多个下游团队,他们使用自己的 AWS 账户和配备 RA3 节点的专用 Amazon Redshift 集群。所有下游团队都需要访问这些集中化数据集。哪种解决方案可以立即提供对数据集的访问,同时保持当前的 Amazon Redshift 性能?
- A. 使用 UNLOAD 命令将数据集复制到 Amazon S3 存储桶。在专用的 AWS Glue Data Catalog 架构中注册表定义。通过 AWS Lake Formation 与其他 AWS 账户共享该架构。使用 Amazon Redshift Spectrum 访问数据。
- B. 创建一个每日抽取、转换和加载(ETL)任务,将数据卸载到 Amazon S3 暂存区域,并指示各个团队将数据复制到其 Amazon Redshift 集群中。
- C. 在 Amazon Redshift 生产集群和消费集群之间设置 Amazon Redshift 数据共享,以便提供对集中化数据集的访问。
- D. 设置一个 AWS DataSync 任务,自动在 Amazon Redshift 生产者集群和消费者集群之间同步数据。
答案: C
解析: Amazon Redshift数据共享是此场景的最佳解决方案,因为它可以在不同的AWS账户之间提供对集中数据集的即时访问,无需复制或移动数据。数据共享允许消费者Redshift集群查询来自生产者集群的实时数据,从而保持Redshift列式存储和大规模并行处理的性能优势。选项A涉及将数据复制到S3并使用Redshift Spectrum,其性能特征不同。选项B仅通过ETL作业提供每日访问,不是即时访问。选项D不合适,因为AWS DataSync并非为同步Redshift集群数据而设计,也无法保持性能或提供即时访问。
第 13 题 · 题号 269 · 单选
一家公司正在搭建一个新的 Amazon SageMaker Unified Studio 域。该公司的每个业务部门都需要对其自己的资产、项目和元数据进行隔离控制。特定数据集经批准后必须能够与其他业务部门共享。公司还要求集中进行用户身份验证和身份映射。哪种解决方案能够满足这些要求?
- A. 将每个业务单元配置为具有委派所有权和细粒度权限策略的域单元。使用户能够通过显式访问控制跨域单元共享资产。为用户分配 API 密钥用于身份验证以访问域门户。
- B. 将业务单元配置为具有所有者权限的独立域单元。限制项目仅由所有者访问,以防止域之间的数据共享。配置 AWS IAM Identity Center 以实现集中身份验证。将用户配置文件映射到其各自的域单元。
- C. 将业务单元配置为单独的域。建立隔离的环境,不共享管理策略。配置 AWS IAM Identity Center 以实现集中身份验证。在域级别委派管理权限。
- D. 将每个业务单元配置为独立的域单元,以便管理资产、项目和元数据的权限。配置 AWS IAM Identity Center 以实现集中身份验证。将用户配置文件映射到其各自的域单元。通过访问请求启用跨业务单元共享。指示域单元所有者批准或拒绝这些请求。
答案: D
解析: 选项D是正确答案,因为它满足了所有三个要求:(1) 每个业务单元被配置为单个SageMaker Unified Studio域内的独立域单元,从而提供对资产、项目和元数据的隔离控制。(2) 配置了AWS IAM Identity Center用于集中式用户身份验证,并将用户配置文件映射到各自的域单元以实现身份映射。(3) 通过访问请求启用跨业务单元共享,由域单元所有者审批或拒绝请求,这直接满足了经批准共享特定数据集的要求。选项A使用API密钥而不是集中式身份验证(不满足要求3)。选项B将项目限制为仅限所有者,阻止了经批准所需的数据共享(不满足要求2)。选项C使用单独的域而不是域单元,这不适合设置单个新域的场景,并造成不必要的行政复杂性。
第 14 题 · 题号 270 · 单选
一家全球性公司目前使用 Amazon Redshift 存储数据,并使用 Amazon Quick Suite(前身为 Amazon QuickSight)生成报表。一组业务分析师拥有不同水平的技术能力,其中一些分析师缺乏 SQL 知识。所有分析师都需要频繁创建新报表。该公司希望使用自然语言查询来更高效地创建仪表板和报表。哪种解决方案能够以最少运维工作量满足这些要求?
- A. 使用具有对 Amazon Redshift 零 ETL 访问权限的 Quick Suite 仪表板。
- B. 在 Quick Suite 中启用 Amazon Q。生成 Quick Suite 仪表板和报告。
- C. 将 Tableau 与 Amazon Redshift 集成,使 Tableau 能够直接访问数据。
- D. 使用具有对 Amazon Redshift 联合查询访问权限的 Quick Suite 仪表板。
答案: B
解析: 关键需求包括:1) 自然语言查询,2) 支持没有 SQL 知识的分析师,3) 最少的运维工作量,4) 已经在使用 Quick Suite。Quick Suite 中的 Amazon Q(前身为 QuickSight Q)专门用于自然语言查询,允许用户用普通英语提问而无需 SQL。由于公司已经在使用 Quick Suite,启用 Amazon Q 几乎不会增加运维负担。选项 A(zero-ETL)只解决数据集成问题,不涉及自然语言。选项 C 引入 Tableau,会显著增加运维工作量。选项 D(联合查询)支持跨数据源查询,但不提供自然语言功能。
第 15 题 · 题号 271 · 单选
一家全球电子商务公司在多个AWS服务中处理客户交易、库存更新和用户活动日志。该公司需要一个可扩展、完全托管且事件驱动的编排解决方案,以协调复杂的提取、转换和加载(ETL)工作流。该解决方案必须使用AWS Glue和Amazon EMR来处理数据。数据将存储在Amazon Redshift和Amazon S3中。该解决方案必须支持依赖关系管理、自动重试和数据管道监控。哪种解决方案能满足这些要求?
- A. 使用 AWS Step Functions 定义一个快速工作流,用于跨 Amazon EMR 和 AWS Glue 调用数据转换和加载任务。
- B. 为工作流的每个步骤创建 AWS Lambda 函数。配置 Amazon EventBridge 以调用 AWS Glue 作业。配置 Lambda 函数以处理数据并使其在管道中流转。
- C. 在 Amazon Managed Workflows for Apache Airflow(Amazon MWAA)上使用 Apache Airflow 创建有向无环图(DAG)来管理 ETL 工作流程。
- D. 创建一个 AWS Lambda 函数来运行工作流程中的每个步骤。创建一个 Amazon EventBridge 计划规则,每天调用该函数。
答案: C
第 16 题 · 题号 272 · 单选
一家公司需要为一个零售购物平台实施实时分析。该公司希望捕获点击流数据,处理这些数据,并将数据加载到 Amazon Redshift 中进行分析。该解决方案必须能够每秒处理数百兆字节的数据。哪种解决方案能够以最低的查询延迟满足这些分析需求?
- A. 使用 Amazon Data Firehose 捕获数据。将数据存储在 Amazon S3 存储桶中。使用 COPY 命令将数据加载到 Amazon Redshift 中。
- B. 使用 Amazon Managed Streaming for Apache Kafka(Amazon MSK)来捕获数据。使用 Amazon EMR 来处理数据。使用联合查询来访问 Amazon Redshift 中的数据。
- C. 使用 Amazon Kinesis Data Streams 捕获数据。使用 Amazon Redshift 流式摄取直接将数据加载到物化视图中。
- D. 使用 Amazon DynamoDB Streams 捕获数据。使用 AWS Glue 处理数据。使用零 ETL 集成将数据加载到 Amazon Redshift。
答案: C
解析: 选项C是最佳选择,因为Amazon Kinesis Data Streams专为实时流式数据和高吞吐量(每秒数百兆字节)而设计,非常适合点击流数据。Amazon Redshift流式摄取允许来自Kinesis Data Streams的数据以最小延迟直接加载到物化视图中,从而提供最低的查询延迟。选项A使用Firehone与S3和COPY命令,这是面向批处理的,延迟较高。选项B使用联邦查询,实际上是查询外部数据,而不是将数据加载到Redshift中进行分析。选项D使用DynamoDB Streams,它是为捕获DynamoDB表的更改而设计的,不适合高容量的点击流数据捕获。
第 17 题 · 题号 273 · 单选
一家公司将一个100 MB的数据集以Apache Parquet文件的格式存储在Amazon S3桶中。一名数据工程师需要在执行数据准备步骤之前对数据进行剖析分析。哪种解决方案能够以最高运营效率满足此要求?
- A. 在 AWS Glue DataBrew 中针对数据集创建概要分析作业。查看概要分析作业结果。
- B. 将数据流式传输到 Amazon Managed Service for Apache Flink 中以进行 SQL 查询。使用 Apache Flink 控制面板来分析数据特征。
- C. 将数据导入 Amazon Redshift Spectrum。使用 SQL 查询来分析数据。
- D. 将数据加载到 Amazon QuickSight 数据集中。创建一个主题,并通过问题来分析数据概况。
答案: A
解析: AWS Glue DataBrew 是专为数据剖析和数据准备而设计的服务。它可以直接从 Amazon S3 读取 Apache Parquet 文件,无需将数据移动或复制到其他位置。DataBrew 提供内置的剖析功能,可以自动生成统计数据和数据质量洞察,且操作开销极低。其他选项的操作效率较低:Apache Flink(B)是为流处理设计的,不适合批量数据剖析;Redshift Spectrum(C)需要搭建和管理 Redshift 集群;QuickSight(D)是商业智能/可视化工具,并非专门的数据剖析服务。因此,选项 A 是运营效率最高的解决方案。
第 18 题 · 题号 274 · 单选
一家公司使用 Amazon Redshift 集群来管理数据,包括供应商销售数据。该公司希望将供应商数据的副本存储在 Amazon S3 存储桶中。一名数据工程师设置了一个 AWS Glue 作业,以按计划将数据上传到 S3 存储桶。数据工程师设置了一个网络连接,以允许 Amazon Redshift 和 Amazon S3 之间的私有流量。满足此要求的下一步是什么?
- A. 创建一个具有写入S3存储桶权限的IAM角色,并将该IAM角色与Amazon Redshift集群相关联。
- B. 将 S3 存储桶添加到 AWS Glue 数据目录。配置 Amazon Redshift Spectrum 以访问数据目录。
- C. 启用 Amazon Redshift 数据共享功能。将 S3 存储桶设置为用于数据共享的目标存储桶。
- D. 将 Amazon Redshift 的登录凭证存储在 AWS Secrets Manager 中。在 Glue 作业配置中添加对该密钥的引用。
答案: A
解析: 正确答案是A,因为公司需要IAM权限来允许Amazon Redshift和Amazon S3之间的数据传输。由于AWS Glue作业负责将供应商数据上传到S3存储桶,因此需要一个具有S3存储桶写入权限的IAM角色。将此IAM角色与Amazon Redshift集群(或Glue作业)关联,可以为私有网络连接的正常工作建立必要的身份验证和授权。选项B(Redshift Spectrum)是错误的,因为它用于从Redshift查询S3中的数据,而不是用于将数据上传到S3。选项C(Redshift数据共享)用于在Redshift集群之间共享数据,与此场景无关。选项D(Secrets Manager)不是必需的,因为Glue可以使用IAM角色对Redshift进行身份验证,无需在Secrets Manager中存储凭据。
第 19 题 · 题号 275 · 单选
一名数据工程师需要一个完全自动化的解决方案,用于检查多个数据库中的新数据并处理该解决方案发现的数据。该解决方案必须每小时运行一次。该解决方案必须兼容 Amazon RDS、Amazon DynamoDB 和 Amazon OpenSearch Service。该解决方案必须能够一次处理最多 10 MB 的数据。该解决方案必须针对成本和运营开销进行优化。该解决方案必须具备强大的错误处理能力。哪种解决方案将满足这些要求?
- A. 使用 Amazon EventBridge 每小时调用一次 AWS Step Functions,以部署 AWS Lambda 函数来检查数据。配置 Step Functions 步骤以处理 Lambda 函数所发现的数据。在每个状态中实现错误处理。
- B. 使用 Amazon EventBridge 每小时调用一次 AWS Lambda 函数以检查数据。配置该函数在发现新数据时向 Amazon Simple Queue Service(Amazon SQS)队列发送消息。使用第二个 Lambda 函数读取该队列并执行处理。
- C. 配置一个 Apache Spark 应用程序,使其在 Amazon EMR 上运行以检查数据。在应用程序中实现错误处理。使用 Amazon EventBridge 每小时调用一次该应用程序。
- D. 使用 Amazon Managed Workflows for Apache Airflow (Amazon MWAA) 创建一个工作流,每小时运行一次有向无环图 (DAG) 以检查数据。配置该 DAG 以处理已识别的数据。在 Python 操作符中实现错误处理。
答案: B
解析: 选项 B 是最佳解决方案,因为它以最优的成本和运营效率满足所有要求。Amazon EventBridge 可以每小时触发一个 AWS Lambda 函数来检查 Amazon RDS、Amazon DynamoDB 和 Amazon OpenSearch Service 中的新数据。Lambda 与这三种数据库类型兼容,并且可以高效地处理高达 10 MB 的数据。当发现新数据时,第一个 Lambda 函数将消息发送到 Amazon SQS 队列,从而将数据检查与数据处理解耦。第二个 Lambda 函数从队列中读取并处理数据。此架构是成本优化的,因为它仅使用 Lambda 和 SQS(两者都是按使用付费,没有空闲成本),运营开销最小(完全托管的服务,无需维护集群),并通过 SQS 功能(如失败消息的死信队列 (DLQ)、可见性超时和自动重试)提供强大的错误处理功能。选项 A 使用 Step Functions,会为此用例增加不必要的成本。选项 C 使用 Amazon EMR,具有较高的运营开销和成本。选项 D 使用 Amazon MWAA,需要集群管理并具有较高的运营开销。
第 20 题 · 题号 276 · 单选
一名数据工程师正在编写查询以在 Amazon Athena 中连接两个表。该数据工程师需要为表选择正确的连接顺序以优化查询性能。哪种解决方案能满足这些要求?
- A. 将较小的表放在连接左侧,将较大的表放在连接右侧。
- B. 指定连接左侧的较大表和连接右侧的较小表。
- C. 在执行连接操作之前,使用 AWS Glue 对表进行预处理。
- D. 使用表统计信息自动确定连接顺序。
答案: B
解析: 在 Amazon Athena(基于 Presto 构建)中,优化连接性能的最佳实践是将较大的表放在连接的左侧,将较小的表放在右侧。这是因为 Athena/Presto 可以将较小的表(在右侧)广播到所有工作节点,从而减少连接操作期间需要在网络上传输的数据量。选项 C 和 D 不是 Athena 中连接顺序优化的标准做法,选项 A 会将较大的表放在右侧,这对于广播连接来说效率较低。