PracticeCF

DEA-C01 题库 · 最新 50 题免费预览(第 5/5 页)

DEA-C01(AWS Certified Data Engineer Associate (DEA-C01))最新题库第 41–50 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 306 题。

第 41 题 · 题号 297 · 单选

一个数据工程师需要部署一个复杂的管道。该管道的各个阶段必须能够运行脚本。数据工程师必须在管道中仅使用完全托管和无服务器的服务。哪种解决方案能够满足这些要求?

答案: A

第 42 题 · 题号 298 · 单选

一家公司需要实施数据网格架构,其中交易、风险和合规团队的域各自拥有自己的数据。各团队需要相互共享特定视图。这些团队在 AWS Glue 数据目录中拥有超过 1,000 张表,分布在 50 个数据库中。三个团队都使用 Amazon Athena 执行按需分析。各团队使用 Amazon Redshift 生成复杂报告。合规团队必须审计所有数据访问。对个人身份信息 (PII) 数据的访问必须受到限制。该公司需要一个可扩展的解决方案来满足团队需求。该解决方案必须提供跨团队域执行分析的能力。哪种解决方案能够满足这些要求?

答案: A

解析: 选项 A 是满足所有要求的最全面的解决方案。它使用 Athena 视图进行跨域按需分析,并使这些视图能够从 Amazon Redshift 中查询以执行复杂的跨域分析。AWS CloudTrail 提供合规团队所需的审计功能,AWS Lake Formation 提供细粒度的访问控制以限制对 PII 数据的访问。该解决方案利用 AWS 原生服务构建了一个可扩展的数据网格架构,既支持 Athena(按需分析)又支持 Redshift(复杂报表)用例,同时保持了适当的访问控制和审计功能。
第 43 题 · 题号 299 · 单选

一家公司拥有一个实时处理交易数据的数据管道。该公司需要一个通知系统,能够根据处理错误的类型无延迟地提醒不同的团队。对于安全相关的错误,系统必须立即通知安全团队。对于数据验证错误,系统必须通知数据质量团队。对于系统错误,系统必须通知运维团队。哪种解决方案能够以最低的运营开销满足这些要求?

答案: B

解析: 选项B使用Amazon EventBridge为每种错误类型配置不同的事件模式,并将它们路由到专用的SNS主题以发送团队特定的通知。EventBridge原生支持实时事件过滤和路由,不需要像选项C中的SQS那样轮询,也不需要像选项A中的Lambda那样额外的计算层。它是一个完全托管的无服务器解决方案,操作开销最小。选项D中的CloudWatch警报是为指标阈值违规设计的,不适用于实时交易错误处理,并且需要更多的配置和管理。选项C使用SQS轮询会引入延迟,与'无任何延迟'的要求相矛盾。EventBridge可直接与数据管道事件集成,SNS通过其专用主题向每个团队提供即时通知。
第 44 题 · 题号 300 · 单选

一位数据工程师正在为一个需要持续摄取数据的应用程序设计日志表。该应用程序必须为其他应用程序提供可靠的、基于 API 的特定记录访问能力。该应用程序必须能够每秒处理超过 4,000 次并发写操作和 6,500 次读操作。哪种解决方案能够满足这些要求?

答案: D

解析: 选择D(使用预置容量的Amazon DynamoDB)是正确答案,原因如下:1)基于API的访问要求 - DynamoDB通过DynamoDB API提供原生基于API的访问,直接满足了对特定记录进行可靠的基于API访问的要求;2)高并发要求 - DynamoDB专门设计用于处理大规模并发操作,可以轻松支持每秒超过4,000次并发写入和6,500次读取;3)特定记录访问 - DynamoDB使用主键提供对特定记录的快速直接访问,这非常适合日志表场景;4)持续摄取 - DynamoDB凭借其可扩展的架构可以很好地处理持续摄取。相比之下,Amazon Redshift(选项A和C)是针对分析查询优化的数据仓库,而不是高并发的OLTP工作负载,并且在并发连接方面存在限制。选项B使用S3和Redshift Spectrum是针对大型数据集的分析查询设计的,而不是用于高频事务操作。
第 45 题 · 题号 301 · 单选

一家公司使用 AWS Glue ETL 管道来处理数据。该公司使用 Amazon Athena 来分析 Amazon S3 存储桶中的数据。为了更好地了解运输时间表,该公司决定除了订单数据之外,还收集和存储运输和交付日期。该公司添加了一项数据质量检查,以确保运输日期晚于订单日期,并且交付日期晚于运输日期。未通过质量检查的订单必须存储在第二个 S3 存储桶中。哪种解决方案能以最具成本效益的方式满足这些要求?

答案: C

解析: AWS Glue Data Quality 是专门用于在 AWS Glue ETL 管道中创建数据质量规则的解决方案。它允许创建跨多个列的自定义规则(在本例中是比较 order_date、shipping_date 和 delivery_date),并且可以将失败的记录分离到不同的目标位置(第二个 S3 存储桶)。选项 A 使用的是 DataBrew,这是一个独立的可视化数据准备服务,成本较高。选项 B 使用的是 Athena,用于查询和分析,不适合用于 ETL 数据质量验证。选项 D 使用的是爬虫程序(crawler),用于模式发现,不能进行质量检查。Glue Data Quality 集成在 Glue 作业中,使其成为此场景中性价比最高的选择。
第 46 题 · 题号 302 · 单选

一家公司正在开发机器学习(ML)模型。数据工程师需要对训练数据应用数据质量规则。该公司将训练数据存储在 Amazon S3 存储桶中。哪种解决方案能够以最少的运营开销满足这些要求?

答案: B

解析: AWS Glue DataBrew 是一项完全托管的无服务器可视化数据准备服务,专为数据质量检查和数据转换任务而设计。它允许数据工程师通过可视化界面定义数据质量规则集,而无需编写自定义代码。当新数据到达 S3 存储桶时,可以通过 Amazon EventBridge 自动触发分析任务,从而无需人工干预。与需要编写和维护 Lambda 函数的选项 A 和 D,以及需要预置和管理 EMR 集群的选项 C 相比,Glue DataBrew 是完全托管且专为数据质量检查而构建的,因此运营开销最低。
第 47 题 · 题号 303 · 单选

一位数据工程师正在配置一个 AWS Glue Apache Spark 提取、转换和加载 (ETL) 作业。该作业包含对两个大型且大小相等的数据框进行排序合并连接。该作业失败并出现以下错误:设备上没有剩余空间。哪种解决方案可以解决此错误?

答案: A

解析: AWS Glue Spark Shuffle Manager 插件专门用于解决在大型 shuffle 操作(如 sort-merge join)过程中出现的“没有可用设备空间”错误。默认情况下,Spark 将 shuffle 数据写入工作节点的本地磁盘,在处理大型数据集时本地磁盘可能会被占满。AWS Glue Spark Shuffle Manager 会将这些 shuffle 数据卸载到 Amazon S3,从而消除本地磁盘空间的限制。选项 B 不可行,因为 AWS Glue 是一种无服务器服务,不支持挂载自定义 EBS 卷。选项 C 不合适,因为广播连接适用于将大型 DataFrame 与小型 DataFrame 相连,而不是两个同样大的 DataFrame(那样会导致内存耗尽)。选项 D 也不能解决 shuffle 操作期间的底层磁盘空间问题。
第 48 题 · 题号 304 · 多选

一位数据工程师正在使用 Apache Iceberg 框架构建一个包含 100 TB 数据的数据湖。该数据工程师希望运行使用 Iceberg 框架的 AWS Glue Apache Spark 作业。哪些步骤组合可以满足这些要求?(选择两项)

答案: C, D

第 49 题 · 题号 305 · 单选

一家公司的数据工程师正在优化提取、转换和加载 (ETL) 工作流。当前的架构使用 Amazon EMR 和 Apache Spark 进行大规模转换,并使用 AWS Glue 处理其他 ETL 任务。这些工作流将处理后的数据加载到基于 Amazon S3 的数据湖中。该公司希望迁移到一个完全托管的无服务器解决方案,该方案能够编排多个 ETL 作业并自动化执行。新解决方案必须继续使用 Spark 来处理数据。公司需要以最少的人工干预来编排和自动化 ETL 工作流。哪种解决方案能够满足这些要求?

答案: A

第 50 题 · 题号 306 · 单选

一家公司为客户生成年度财务报表,并将这些报表存储在 Amazon S3 存储桶中。客户在 1 周后很少访问这些文档。公司必须将这些报表保留 7 年,并且这些报表必须能够随时供客户访问。哪种解决方案能以最具成本效益的方式满足这些要求?

答案: C

解析: 选项C是最经济实惠且满足所有要求的解决方案。S3 Glacier Instant Retrieval提供毫秒级检索时间,满足'随时可访问'的要求,同时在长期存储方面比S3 Standard便宜得多。在频繁访问期结束后,7天后过渡到Glacier Instant Retrieval,然后7年后过期,这与所述访问模式最佳匹配。选项A(Deep Archive)失败,因为检索需要12-48小时,不是'随时可访问'。选项B(Intelligent-Tiering)会产生每个对象的监控费用,对于此类可预测的访问模式来说成本更高。选项D不是最优的,因为它立即将新对象放入更昂贵的Glacier Instant Retrieval中,而不是在初始高访问期使用更便宜的S3 Standard。
上一页 12345