DEA-C01 题库 · 最新 50 题免费预览(第 3/5 页)
DEA-C01(AWS Certified Data Engineer Associate (DEA-C01))最新题库第 21–30 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 306 题。
第 21 题 · 题号 277 · 单选
一家零售公司需要实施一个解决方案,以从多个 Amazon Aurora MySQL 数据库捕获数据更新。该公司需要使这些更新在近乎实时的情况下可供分析使用。该解决方案必须是无服务器的,并且需要尽可能少的维护。哪种解决方案将以最小的运营开销满足这些要求?
- A. 为每个数据库设置执行架构转换的 AWS 数据库迁移服务 (AWS DMS) 任务,并将变更加载到 Amazon Redshift Serverless 中。
- B. 使用 Amazon Managed Streaming for Apache Kafka(Amazon MSK)Connect 与 Debezium 连接器将数据加载到 Amazon Redshift Serverless。
- C. 使用 AWS 数据库迁移服务(AWS DMS)设置到 Amazon Kinesis Data Streams 的二进制日志复制。在架构转换后,将数据加载到 Amazon Redshift Serverless。
- D. 为每个数据库使用 Aurora 与 Amazon Redshift Serverless 的零 ETL 集成,以将 Aurora MySQL 的更改加载到 Amazon Redshift Serverless 中。
答案: D
解析: Aurora zero-ETL 与 Amazon Redshift Serverless 的集成是最佳解决方案,因为它专为近实时数据复制而设计,无需 ETL 管道即可将数据从 Aurora MySQL 复制到 Redshift。它是无服务器的,需要最少的维护,并且与其他选项相比具有最低的运营开销。选项 A 和 C 需要管理带有模式转换的 AWS DMS 任务,增加了复杂性。选项 B 需要管理 Amazon MSK 集群(非无服务器)和 Debezium 连接器,这会增加运营开销。
第 22 题 · 题号 278 · 单选
一家医疗保健公司将患者记录存储在本地 MySQL 数据库中。该公司创建了一个应用程序来访问 MySQL 数据库。该公司必须实施安全协议以保护患者记录。该公司目前每 30 天轮换一次数据库凭证,以尽量降低未经授权访问的风险。该公司希望采用一种不需要在每次轮换凭证时修改应用程序代码的解决方案。哪种解决方案能以最少运营开销满足此要求?
- A. 为数据库分配 IAM 角色访问权限。配置应用程序通过 IAM 角色获取临时凭证。
- B. 使用 AWS Key Management Service (AWS KMS) 生成加密密钥。配置自动密钥轮换。将加密后的凭证存储在 Amazon DynamoDB 表中。
- C. 使用 AWS Secrets Manager 自动轮换凭证。允许应用程序通过 API 调用来检索凭证。
- D. 将凭证存储在加密的 Amazon S3 存储桶中。通过使用 S3 生命周期策略每月轮换凭证。使用存储桶策略来控制访问。
答案: C
解析: AWS Secrets Manager 专门用于处理自动凭证轮换和检索,无需修改应用程序代码。它允许应用程序通过 API 调用获取凭证,这意味着当凭证轮换时,应用程序不需要修改——它只需调用 Secrets Manager API 来获取当前有效的凭证。这同时满足两个要求:每次轮换无需修改代码,以及运维开销最小,因为 AWS 管理整个轮换过程。选项 A 不正确,因为 IAM 角色适用于 AWS 服务,不适用于本地 MySQL 数据库。选项 B 是关于加密密钥,而不是凭证轮换/访问。选项 D 不正确,因为 S3 生命周期策略管理对象生命周期,而不是凭证轮换。
第 23 题 · 题号 279 · 单选
一家公司拥有一个基于 Amazon S3 的数据湖。该数据湖包含属于多个部门的数据集,并且每天会接收数百万条客户记录。数据工程师需要设计一种访问和存储解决方案,使各部门只能访问其所需的公司数据子集。该解决方案必须遵循最小权限原则。哪种解决方案能以最少的运维工作量满足这些要求?
- A. 为每个部门定义 IAM 策略和 IAM 角色。指定每个团队可以从数据湖访问的 S3 访问路径。
- B. 将 Amazon Redshift 和 Amazon Redshift Spectrum 设置为数据湖的主要入口点。定义一个 Amazon Redshift 可以代入的 IAM 角色。配置 IAM 角色以授予对 Amazon S3 中数据的访问权限。
- C. 设置 AWS Lake Formation。为 AWS Glue 数据目录资源分配 LF-Tags。启用 Lake Formation 基于标签的访问控制 (LF-TBAC)。
- D. 部署一个安装了 aws_s3 扩展的 Amazon RDS for PostgreSQL 数据库。配置 AWS Step Functions 事件以调用 AWS Lambda 函数,从而使数据湖与数据库保持同步。
答案: C
解析: AWS Lake Formation 结合 LF-Tags 和基于标签的访问控制(LF-TBAC)是专门为跨多个部门管理数据湖资源的细粒度访问而设计的,且运营开销最小。LF-TBAC 允许您为数据目录资源分配标签,然后根据这些标签授予权限,随着新数据集的添加可以高效扩展,无需频繁更新策略。选项 A 需要创建和维护许多 IAM 策略(运营开销高)。选项 B 引入了不必要的 Redshift 基础设施复杂性。选项 D 需要额外的 RDS、Lambda 和 Step Functions 基础设施以及数据同步开销。
第 24 题 · 题号 280 · 单选
一家公司需要存储和分析大量的物联网传感器数据。该公司需要无限期地保留这些数据。公司在 Amazon Redshift 集群中分析这些数据。哪种解决方案能够以最低成本满足这些要求?
- A. 将数据以 JSON 格式存储在 Amazon S3 存储桶中。配置从 S3 存储桶到 Redshift 集群的自动复制数据摄取。
- B. 将数据以 Apache Parquet 格式存储在 Amazon S3 存储桶中。通过 Amazon Redshift Spectrum 配置查询访问。
- C. 将数据以 JSON 格式存储在 Amazon S3 存储桶中,并通过 Amazon Redshift Spectrum 配置查询访问。
- D. 将数据以 Apache Parquet 格式存储在 Amazon S3 存储桶中。配置从 S3 存储桶到 Redshift 集群的自动复制数据摄取。
答案: B
解析: 选项B是最具成本效益的解决方案,因为Apache Parquet是一种列式存储格式,可以提供高压缩比,与JSON相比显著降低了存储成本。Amazon Redshift Spectrum允许直接在S3中查询数据,无需将数据加载到Redshift中,从而为需要无限期保留的数据消除了昂贵的Redshift存储和计算资源需求。这种组合最大程度地降低了存储成本(S3中的Parquet压缩)和计算成本(通过Spectrum直接查询,而不是将数据摄取到集群中)。
第 25 题 · 题号 281 · 单选
一家零售公司希望为其电子商务平台实施实时分析。该公司需要从公司网站和移动应用中收集点击流数据,并存储这些数据用于分析。哪种解决方案能够以最少的持续维护满足这些要求?
- A. 使用 Amazon Data Firehose 摄取流式数据,并将处理后的数据直接传送至已预置的 Amazon Redshift 集群。
- B. 在 Amazon EC2 实例上部署代理以收集流数据。使用 AWS CLI 定期将数据批量上传到 Amazon S3 存储桶。
- C. 使用 Amazon Kinesis Data Streams 收集流式数据。使用 Amazon Data Firehose 将数据传送到 Amazon S3 存储桶。
- D. 使用 Amazon Managed Streaming for Apache Kafka(Amazon MSK)代理来收集数据。将数据存储在 Amazon RDS 数据库实例中。
答案: C
解析: Amazon Kinesis Data Streams 提供完全托管的服务来收集实时点击流数据,Amazon Data Firehose 则通过完全托管的传输服务将数据加载到 Amazon S3 中以供分析。与预置 Redshift 集群、管理 EC2 代理,以及运维 MSK 和 RDS 相比,这种组合可以最大程度地减少持续的基础设施维护工作。
第 26 题 · 题号 282 · 单选
一家公司创建了一个运行在 Amazon EC2 实例上的新的非生产应用程序。该应用程序需要使用 Java 数据库连接 (JDBC) 与 Amazon RDS 数据库实例进行通信。EC2 实例和 RDS 数据库实例位于同一子网中。哪种解决方案可以满足此要求?
- A. 修改分配给数据库实例的 IAM 角色,以允许来自 EC2 实例的连接。
- B. 修改 RDS 参数组中的 ec2_authorized_hosts 参数,以包含 EC2 实例。重启数据库实例。
- C. 更新数据库安全组以允许来自EC2实例的连接。
- D. 启用 Amazon RDS Data API,并在 JDBC 连接字符串中指定数据库实例的 Amazon 资源名称 (ARN)。
答案: C
解析: 要允许EC2实例使用JDBC与RDS数据库实例通信,必须配置RDS数据库的安全组以允许来自EC2实例的入站连接。安全组充当实例级别的虚拟防火墙,用于控制网络流量。选项A不正确,因为附加到RDS实例的IAM角色用于AWS管理任务(例如S3导出、CloudWatch日志),而不是用于应用程序级别的JDBC身份验证。选项B不正确,因为'ec2_authorized_hosts'不是有效的RDS参数。选项D不正确,因为RDS Data API使用基于HTTP的API,与JDBC连接不兼容。
第 27 题 · 题号 283 · 单选
一家公司使用 AWS Step Functions 来编排数据管道。该公司已配置 Step Functions 日志在日志级别为 FATAL 时推送到 Amazon CloudWatch Logs。该公司已为管道中的所有 AWS 服务启用日志。一个名为 "preprocessing" 的状态调用一个名为 "preprocessing" 的 AWS Lambda 函数。该 Lambda 函数在进入下一个状态之前对数据进行预处理。该公司需要在数据预处理过程中发生错误时查找错误详细信息。应该检查哪个 CloudWatch Logs 日志组来查找错误详细信息?
- A. 在 /aws/vendedlogs/states 日志组中的 Step Functions TaskFailed 事件
- B. AWS CloudTrail 在 CloudTrail/logs/preprocessing 日志组中记录 SendTaskFailure 事件。
- C. laws/lambda/preprocessing 日志组中的 Lambda 日志
- D. 在 /aws/vendedlogs/states 日志组中的 Step Functions TaskSucceeded 事件
答案: C
解析: 当AWS Lambda函数被调用并发生错误时,详细的错误信息(包括堆栈跟踪和错误消息)会自动写入该Lambda函数自己的CloudWatch Logs日志组,位于/aws/lambda/<函数名称>。虽然Step Functions确实会记录TaskFailed事件到/aws/vendedlogs/states,但这些日志只表明任务失败并提供有限的上下文信息。要获取来自预处理Lambda函数本身的详细错误信息,公司应该检查该Lambda函数专用的日志组/aws/lambda/preprocessing,其中包含函数执行中的完整错误详细信息。
第 28 题 · 题号 284 · 单选
一个应用程序使用配置了托管运行时的 AWS Lambda 函数。该 Lambda 函数成功地将日志写入默认的 Amazon CloudWatch Logs 日志组。数据工程师希望修改日志记录行为,使其仅显示应用程序日志的 ERROR 级别和系统日志的 WARN 级别。哪种解决方案能满足这些要求?
- A. 向 Lambda 执行角色添加其他权限。
- B. 在 Lambda 函数代码中将日志级别设置为 ERROR。
- C. 将 Lambda 函数配置为使用 JSON 日志格式。
- D. 配置 Lambda 函数以将日志发送到自定义日志组。
答案: B
解析: 选项B是正确答案,因为它是唯一涉及日志级别过滤的选项。在Lambda函数代码中设置日志级别为ERROR将过滤应用程序日志,使其仅显示ERROR级别的条目。选项A(权限)、C(JSON格式)和D(自定义日志组)都不能控制日志级别——权限影响授权,JSON格式影响日志结构,自定义日志组仅更改目标位置。在AWS Lambda托管运行时中,应用程序日志级别由代码的日志配置控制。
第 29 题 · 题号 285 · 单选
一名数据工程师需要验证每天上传到 Amazon S3 存储桶的文件质量。这些文件采用 CSV 和 JSON 格式,并且存在模式变化。该数据工程师需要一个可重复的过程来监控数据质量指标,例如空值、格式不一致和异常值。该过程必须提供可重用的基于规则的剖析功能,并以最少的人工操作或自定义代码跨多个数据集进行扩展。哪种解决方案能满足这些要求?
- A. 使用 AWS Glue Studio 创建一个每日抽取、转换和加载(ETL)管道,通过 PySpark 转换合并数据集并应用验证逻辑。
- B. 使用 AWS Glue 提取、转换和加载(ETL)作业,结合动态帧和 ResolveChoice 类,来对齐架构并检测文件之间的结构差异。
- C. 使用 AWS Glue DataBrew 配置分析作业和可重复使用的配方操作。安排分析作业和可重复使用的配方操作对 Amazon S3 中的每个数据集运行。
- D. 使用 AWS Glue DataBrew 为每个数据集生成分析仪表板。通过人工审查监控质量指标。
答案: C
解析: 选项 C 是最佳解决方案,因为 AWS Glue DataBrew 专门为数据剖析和质量监控而设计,无需编写自定义代码。它提供内置的剖析作业,可以检测 CSV 和 JSON 文件中的空值、格式不一致和异常值。DataBrew 的可重用配方支持基于规则的数据剖析,可应用于多个数据集,并且通过调度作业可以消除手动操作。选项 A 需要自定义 PySpark 代码(与最小化自定义代码的要求相矛盾)。选项 B 侧重于模式对齐而非数据质量指标。选项 D 依赖手动查看仪表板,这与最小化手动操作的要求相矛盾。
第 30 题 · 题号 286 · 单选
一家公司需要一个解决方案,使用 Apache Spark 在 Kubernetes 环境中处理流数据。该解决方案必须支持事件驱动型扩展并优化资源利用率。该公司需要将该解决方案与部署在 Amazon Elastic Kubernetes Service(Amazon EKS)上的现有 Kubernetes 基础设施集成。哪种解决方案能够以最低的运营开销满足这些要求?
- A. 通过使用基于 Kubernetes 事件驱动自动伸缩(KEDA)operator 的自定义自动伸缩策略,在 Amazon EKS 上部署自管 Apache Spark。
- B. 将 Amazon EKS 上的 Amazon EMR 与 Kubernetes Event-Driven Autoscaling (KEDA) 结合使用,实现 Spark 应用程序的事件驱动型自动扩展。
- C. 在 Amazon EKS 上使用 Amazon EMR 和 Kubernetes 集群自动扩缩器,根据 Kubernetes 指标服务器生成的指标事件来扩缩 Spark 应用程序。
- D. 在 Amazon EKS 上部署 Apache Spark,并使用 AWS 自动扩缩组和基于 Kubernetes Metrics Server 收集的指标事件的自定义扩缩策略。
答案: B
解析: 选项B是最佳选择,因为Amazon EMR on Amazon EKS是一项托管服务,与自管理的Apache Spark相比,它显著降低了运营开销。EMR on EKS专为在Kubernetes上运行Apache Spark工作负载而设计,可优化资源利用率。此外,KEDA(Kubernetes事件驱动自动伸缩)提供真正的事件驱动伸缩功能,完全符合对事件驱动伸缩的要求。这种组合在满足所有既定要求的同时,提供了最低的运营开销。