PracticeCF

DEA-C01 题库 · 最新 50 题免费预览(第 3/5 页)

DEA-C01(AWS Certified Data Engineer Associate (DEA-C01))最新题库第 21–30 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 306 题。

第 21 题 · 题号 277 · 单选

一家零售公司需要实施一个解决方案,以从多个 Amazon Aurora MySQL 数据库捕获数据更新。该公司需要使这些更新在近乎实时的情况下可供分析使用。该解决方案必须是无服务器的,并且需要尽可能少的维护。哪种解决方案将以最小的运营开销满足这些要求?

答案: D

解析: Aurora zero-ETL 与 Amazon Redshift Serverless 的集成是最佳解决方案,因为它专为近实时数据复制而设计,无需 ETL 管道即可将数据从 Aurora MySQL 复制到 Redshift。它是无服务器的,需要最少的维护,并且与其他选项相比具有最低的运营开销。选项 A 和 C 需要管理带有模式转换的 AWS DMS 任务,增加了复杂性。选项 B 需要管理 Amazon MSK 集群(非无服务器)和 Debezium 连接器,这会增加运营开销。
第 22 题 · 题号 278 · 单选

一家医疗保健公司将患者记录存储在本地 MySQL 数据库中。该公司创建了一个应用程序来访问 MySQL 数据库。该公司必须实施安全协议以保护患者记录。该公司目前每 30 天轮换一次数据库凭证,以尽量降低未经授权访问的风险。该公司希望采用一种不需要在每次轮换凭证时修改应用程序代码的解决方案。哪种解决方案能以最少运营开销满足此要求?

答案: C

解析: AWS Secrets Manager 专门用于处理自动凭证轮换和检索,无需修改应用程序代码。它允许应用程序通过 API 调用获取凭证,这意味着当凭证轮换时,应用程序不需要修改——它只需调用 Secrets Manager API 来获取当前有效的凭证。这同时满足两个要求:每次轮换无需修改代码,以及运维开销最小,因为 AWS 管理整个轮换过程。选项 A 不正确,因为 IAM 角色适用于 AWS 服务,不适用于本地 MySQL 数据库。选项 B 是关于加密密钥,而不是凭证轮换/访问。选项 D 不正确,因为 S3 生命周期策略管理对象生命周期,而不是凭证轮换。
第 23 题 · 题号 279 · 单选

一家公司拥有一个基于 Amazon S3 的数据湖。该数据湖包含属于多个部门的数据集,并且每天会接收数百万条客户记录。数据工程师需要设计一种访问和存储解决方案,使各部门只能访问其所需的公司数据子集。该解决方案必须遵循最小权限原则。哪种解决方案能以最少的运维工作量满足这些要求?

答案: C

解析: AWS Lake Formation 结合 LF-Tags 和基于标签的访问控制(LF-TBAC)是专门为跨多个部门管理数据湖资源的细粒度访问而设计的,且运营开销最小。LF-TBAC 允许您为数据目录资源分配标签,然后根据这些标签授予权限,随着新数据集的添加可以高效扩展,无需频繁更新策略。选项 A 需要创建和维护许多 IAM 策略(运营开销高)。选项 B 引入了不必要的 Redshift 基础设施复杂性。选项 D 需要额外的 RDS、Lambda 和 Step Functions 基础设施以及数据同步开销。
第 24 题 · 题号 280 · 单选

一家公司需要存储和分析大量的物联网传感器数据。该公司需要无限期地保留这些数据。公司在 Amazon Redshift 集群中分析这些数据。哪种解决方案能够以最低成本满足这些要求?

答案: B

解析: 选项B是最具成本效益的解决方案,因为Apache Parquet是一种列式存储格式,可以提供高压缩比,与JSON相比显著降低了存储成本。Amazon Redshift Spectrum允许直接在S3中查询数据,无需将数据加载到Redshift中,从而为需要无限期保留的数据消除了昂贵的Redshift存储和计算资源需求。这种组合最大程度地降低了存储成本(S3中的Parquet压缩)和计算成本(通过Spectrum直接查询,而不是将数据摄取到集群中)。
第 25 题 · 题号 281 · 单选

一家零售公司希望为其电子商务平台实施实时分析。该公司需要从公司网站和移动应用中收集点击流数据,并存储这些数据用于分析。哪种解决方案能够以最少的持续维护满足这些要求?

答案: C

解析: Amazon Kinesis Data Streams 提供完全托管的服务来收集实时点击流数据,Amazon Data Firehose 则通过完全托管的传输服务将数据加载到 Amazon S3 中以供分析。与预置 Redshift 集群、管理 EC2 代理,以及运维 MSK 和 RDS 相比,这种组合可以最大程度地减少持续的基础设施维护工作。
第 26 题 · 题号 282 · 单选

一家公司创建了一个运行在 Amazon EC2 实例上的新的非生产应用程序。该应用程序需要使用 Java 数据库连接 (JDBC) 与 Amazon RDS 数据库实例进行通信。EC2 实例和 RDS 数据库实例位于同一子网中。哪种解决方案可以满足此要求?

答案: C

解析: 要允许EC2实例使用JDBC与RDS数据库实例通信,必须配置RDS数据库的安全组以允许来自EC2实例的入站连接。安全组充当实例级别的虚拟防火墙,用于控制网络流量。选项A不正确,因为附加到RDS实例的IAM角色用于AWS管理任务(例如S3导出、CloudWatch日志),而不是用于应用程序级别的JDBC身份验证。选项B不正确,因为'ec2_authorized_hosts'不是有效的RDS参数。选项D不正确,因为RDS Data API使用基于HTTP的API,与JDBC连接不兼容。
第 27 题 · 题号 283 · 单选

一家公司使用 AWS Step Functions 来编排数据管道。该公司已配置 Step Functions 日志在日志级别为 FATAL 时推送到 Amazon CloudWatch Logs。该公司已为管道中的所有 AWS 服务启用日志。一个名为 "preprocessing" 的状态调用一个名为 "preprocessing" 的 AWS Lambda 函数。该 Lambda 函数在进入下一个状态之前对数据进行预处理。该公司需要在数据预处理过程中发生错误时查找错误详细信息。应该检查哪个 CloudWatch Logs 日志组来查找错误详细信息?

答案: C

解析: 当AWS Lambda函数被调用并发生错误时,详细的错误信息(包括堆栈跟踪和错误消息)会自动写入该Lambda函数自己的CloudWatch Logs日志组,位于/aws/lambda/<函数名称>。虽然Step Functions确实会记录TaskFailed事件到/aws/vendedlogs/states,但这些日志只表明任务失败并提供有限的上下文信息。要获取来自预处理Lambda函数本身的详细错误信息,公司应该检查该Lambda函数专用的日志组/aws/lambda/preprocessing,其中包含函数执行中的完整错误详细信息。
第 28 题 · 题号 284 · 单选

一个应用程序使用配置了托管运行时的 AWS Lambda 函数。该 Lambda 函数成功地将日志写入默认的 Amazon CloudWatch Logs 日志组。数据工程师希望修改日志记录行为,使其仅显示应用程序日志的 ERROR 级别和系统日志的 WARN 级别。哪种解决方案能满足这些要求?

答案: B

解析: 选项B是正确答案,因为它是唯一涉及日志级别过滤的选项。在Lambda函数代码中设置日志级别为ERROR将过滤应用程序日志,使其仅显示ERROR级别的条目。选项A(权限)、C(JSON格式)和D(自定义日志组)都不能控制日志级别——权限影响授权,JSON格式影响日志结构,自定义日志组仅更改目标位置。在AWS Lambda托管运行时中,应用程序日志级别由代码的日志配置控制。
第 29 题 · 题号 285 · 单选

一名数据工程师需要验证每天上传到 Amazon S3 存储桶的文件质量。这些文件采用 CSV 和 JSON 格式,并且存在模式变化。该数据工程师需要一个可重复的过程来监控数据质量指标,例如空值、格式不一致和异常值。该过程必须提供可重用的基于规则的剖析功能,并以最少的人工操作或自定义代码跨多个数据集进行扩展。哪种解决方案能满足这些要求?

答案: C

解析: 选项 C 是最佳解决方案,因为 AWS Glue DataBrew 专门为数据剖析和质量监控而设计,无需编写自定义代码。它提供内置的剖析作业,可以检测 CSV 和 JSON 文件中的空值、格式不一致和异常值。DataBrew 的可重用配方支持基于规则的数据剖析,可应用于多个数据集,并且通过调度作业可以消除手动操作。选项 A 需要自定义 PySpark 代码(与最小化自定义代码的要求相矛盾)。选项 B 侧重于模式对齐而非数据质量指标。选项 D 依赖手动查看仪表板,这与最小化手动操作的要求相矛盾。
第 30 题 · 题号 286 · 单选

一家公司需要一个解决方案,使用 Apache Spark 在 Kubernetes 环境中处理流数据。该解决方案必须支持事件驱动型扩展并优化资源利用率。该公司需要将该解决方案与部署在 Amazon Elastic Kubernetes Service(Amazon EKS)上的现有 Kubernetes 基础设施集成。哪种解决方案能够以最低的运营开销满足这些要求?

答案: B

解析: 选项B是最佳选择,因为Amazon EMR on Amazon EKS是一项托管服务,与自管理的Apache Spark相比,它显著降低了运营开销。EMR on EKS专为在Kubernetes上运行Apache Spark工作负载而设计,可优化资源利用率。此外,KEDA(Kubernetes事件驱动自动伸缩)提供真正的事件驱动伸缩功能,完全符合对事件驱动伸缩的要求。这种组合在满足所有既定要求的同时,提供了最低的运营开销。
上一页 12345 下一页