PracticeCF

DEA-C01 题库 · 最新 50 题免费预览(第 2/5 页)

DEA-C01(AWS Certified Data Engineer Associate (DEA-C01))最新题库第 11–20 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 306 题。

第 11 题 · 题号 267 · 单选

一家全球金融公司需要在美国东部1区、欧洲西部2区和亚太东北1区的交易中心之间实施交易数据的近实时跨区域同步。该公司必须确保数据在传输过程中加密。解决方案必须确保数据顺序和一致性,并必须支持跨区域灾难恢复。解决方案必须提供低于500毫秒的数据延迟。哪种解决方案将以最少的运维工作量满足这些要求?

答案: B

解析: 选项B是最佳选择,因为Amazon MSK Replicator是一项完全托管的服务,可以以最小的运营工作量处理MSK集群之间的跨区域复制。它自动处理数据排序和一致性,并提供TLS加密和IAM身份验证。“完全互连的复制”功能支持灾难恢复要求,作为托管服务,与自行管理Apache Kafka Connect(选项A)或MirrorMaker 2.0(选项C)相比,它所需的运营开销显著降低。选项D过于复杂,将Kinesis Data Streams和Firehose与MSK集群混合使用,增加了运营复杂性。
第 12 题 · 题号 268 · 单选

一家大公司的数据工程师需要创建针对 Amazon Redshift 性能进行优化的集中化数据集。该公司有多个下游团队,他们使用自己的 AWS 账户和配备 RA3 节点的专用 Amazon Redshift 集群。所有下游团队都需要访问这些集中化数据集。哪种解决方案可以立即提供对数据集的访问,同时保持当前的 Amazon Redshift 性能?

答案: C

解析: Amazon Redshift数据共享是此场景的最佳解决方案,因为它可以在不同的AWS账户之间提供对集中数据集的即时访问,无需复制或移动数据。数据共享允许消费者Redshift集群查询来自生产者集群的实时数据,从而保持Redshift列式存储和大规模并行处理的性能优势。选项A涉及将数据复制到S3并使用Redshift Spectrum,其性能特征不同。选项B仅通过ETL作业提供每日访问,不是即时访问。选项D不合适,因为AWS DataSync并非为同步Redshift集群数据而设计,也无法保持性能或提供即时访问。
第 13 题 · 题号 269 · 单选

一家公司正在搭建一个新的 Amazon SageMaker Unified Studio 域。该公司的每个业务部门都需要对其自己的资产、项目和元数据进行隔离控制。特定数据集经批准后必须能够与其他业务部门共享。公司还要求集中进行用户身份验证和身份映射。哪种解决方案能够满足这些要求?

答案: D

解析: 选项D是正确答案,因为它满足了所有三个要求:(1) 每个业务单元被配置为单个SageMaker Unified Studio域内的独立域单元,从而提供对资产、项目和元数据的隔离控制。(2) 配置了AWS IAM Identity Center用于集中式用户身份验证,并将用户配置文件映射到各自的域单元以实现身份映射。(3) 通过访问请求启用跨业务单元共享,由域单元所有者审批或拒绝请求,这直接满足了经批准共享特定数据集的要求。选项A使用API密钥而不是集中式身份验证(不满足要求3)。选项B将项目限制为仅限所有者,阻止了经批准所需的数据共享(不满足要求2)。选项C使用单独的域而不是域单元,这不适合设置单个新域的场景,并造成不必要的行政复杂性。
第 14 题 · 题号 270 · 单选

一家全球性公司目前使用 Amazon Redshift 存储数据,并使用 Amazon Quick Suite(前身为 Amazon QuickSight)生成报表。一组业务分析师拥有不同水平的技术能力,其中一些分析师缺乏 SQL 知识。所有分析师都需要频繁创建新报表。该公司希望使用自然语言查询来更高效地创建仪表板和报表。哪种解决方案能够以最少运维工作量满足这些要求?

答案: B

解析: 关键需求包括:1) 自然语言查询,2) 支持没有 SQL 知识的分析师,3) 最少的运维工作量,4) 已经在使用 Quick Suite。Quick Suite 中的 Amazon Q(前身为 QuickSight Q)专门用于自然语言查询,允许用户用普通英语提问而无需 SQL。由于公司已经在使用 Quick Suite,启用 Amazon Q 几乎不会增加运维负担。选项 A(zero-ETL)只解决数据集成问题,不涉及自然语言。选项 C 引入 Tableau,会显著增加运维工作量。选项 D(联合查询)支持跨数据源查询,但不提供自然语言功能。
第 15 题 · 题号 271 · 单选

一家全球电子商务公司在多个AWS服务中处理客户交易、库存更新和用户活动日志。该公司需要一个可扩展、完全托管且事件驱动的编排解决方案,以协调复杂的提取、转换和加载(ETL)工作流。该解决方案必须使用AWS Glue和Amazon EMR来处理数据。数据将存储在Amazon Redshift和Amazon S3中。该解决方案必须支持依赖关系管理、自动重试和数据管道监控。哪种解决方案能满足这些要求?

答案: C

第 16 题 · 题号 272 · 单选

一家公司需要为一个零售购物平台实施实时分析。该公司希望捕获点击流数据,处理这些数据,并将数据加载到 Amazon Redshift 中进行分析。该解决方案必须能够每秒处理数百兆字节的数据。哪种解决方案能够以最低的查询延迟满足这些分析需求?

答案: C

解析: 选项C是最佳选择,因为Amazon Kinesis Data Streams专为实时流式数据和高吞吐量(每秒数百兆字节)而设计,非常适合点击流数据。Amazon Redshift流式摄取允许来自Kinesis Data Streams的数据以最小延迟直接加载到物化视图中,从而提供最低的查询延迟。选项A使用Firehone与S3和COPY命令,这是面向批处理的,延迟较高。选项B使用联邦查询,实际上是查询外部数据,而不是将数据加载到Redshift中进行分析。选项D使用DynamoDB Streams,它是为捕获DynamoDB表的更改而设计的,不适合高容量的点击流数据捕获。
第 17 题 · 题号 273 · 单选

一家公司将一个100 MB的数据集以Apache Parquet文件的格式存储在Amazon S3桶中。一名数据工程师需要在执行数据准备步骤之前对数据进行剖析分析。哪种解决方案能够以最高运营效率满足此要求?

答案: A

解析: AWS Glue DataBrew 是专为数据剖析和数据准备而设计的服务。它可以直接从 Amazon S3 读取 Apache Parquet 文件,无需将数据移动或复制到其他位置。DataBrew 提供内置的剖析功能,可以自动生成统计数据和数据质量洞察,且操作开销极低。其他选项的操作效率较低:Apache Flink(B)是为流处理设计的,不适合批量数据剖析;Redshift Spectrum(C)需要搭建和管理 Redshift 集群;QuickSight(D)是商业智能/可视化工具,并非专门的数据剖析服务。因此,选项 A 是运营效率最高的解决方案。
第 18 题 · 题号 274 · 单选

一家公司使用 Amazon Redshift 集群来管理数据,包括供应商销售数据。该公司希望将供应商数据的副本存储在 Amazon S3 存储桶中。一名数据工程师设置了一个 AWS Glue 作业,以按计划将数据上传到 S3 存储桶。数据工程师设置了一个网络连接,以允许 Amazon Redshift 和 Amazon S3 之间的私有流量。满足此要求的下一步是什么?

答案: A

解析: 正确答案是A,因为公司需要IAM权限来允许Amazon Redshift和Amazon S3之间的数据传输。由于AWS Glue作业负责将供应商数据上传到S3存储桶,因此需要一个具有S3存储桶写入权限的IAM角色。将此IAM角色与Amazon Redshift集群(或Glue作业)关联,可以为私有网络连接的正常工作建立必要的身份验证和授权。选项B(Redshift Spectrum)是错误的,因为它用于从Redshift查询S3中的数据,而不是用于将数据上传到S3。选项C(Redshift数据共享)用于在Redshift集群之间共享数据,与此场景无关。选项D(Secrets Manager)不是必需的,因为Glue可以使用IAM角色对Redshift进行身份验证,无需在Secrets Manager中存储凭据。
第 19 题 · 题号 275 · 单选

一名数据工程师需要一个完全自动化的解决方案,用于检查多个数据库中的新数据并处理该解决方案发现的数据。该解决方案必须每小时运行一次。该解决方案必须兼容 Amazon RDS、Amazon DynamoDB 和 Amazon OpenSearch Service。该解决方案必须能够一次处理最多 10 MB 的数据。该解决方案必须针对成本和运营开销进行优化。该解决方案必须具备强大的错误处理能力。哪种解决方案将满足这些要求?

答案: B

解析: 选项 B 是最佳解决方案,因为它以最优的成本和运营效率满足所有要求。Amazon EventBridge 可以每小时触发一个 AWS Lambda 函数来检查 Amazon RDS、Amazon DynamoDB 和 Amazon OpenSearch Service 中的新数据。Lambda 与这三种数据库类型兼容,并且可以高效地处理高达 10 MB 的数据。当发现新数据时,第一个 Lambda 函数将消息发送到 Amazon SQS 队列,从而将数据检查与数据处理解耦。第二个 Lambda 函数从队列中读取并处理数据。此架构是成本优化的,因为它仅使用 Lambda 和 SQS(两者都是按使用付费,没有空闲成本),运营开销最小(完全托管的服务,无需维护集群),并通过 SQS 功能(如失败消息的死信队列 (DLQ)、可见性超时和自动重试)提供强大的错误处理功能。选项 A 使用 Step Functions,会为此用例增加不必要的成本。选项 C 使用 Amazon EMR,具有较高的运营开销和成本。选项 D 使用 Amazon MWAA,需要集群管理并具有较高的运营开销。
第 20 题 · 题号 276 · 单选

一名数据工程师正在编写查询以在 Amazon Athena 中连接两个表。该数据工程师需要为表选择正确的连接顺序以优化查询性能。哪种解决方案能满足这些要求?

答案: B

解析: 在 Amazon Athena(基于 Presto 构建)中,优化连接性能的最佳实践是将较大的表放在连接的左侧,将较小的表放在右侧。这是因为 Athena/Presto 可以将较小的表(在右侧)广播到所有工作节点,从而减少连接操作期间需要在网络上传输的数据量。选项 C 和 D 不是 Athena 中连接顺序优化的标准做法,选项 A 会将较大的表放在右侧,这对于广播连接来说效率较低。
上一页 12345 下一页