DEA-C01 题库 · 最新 50 题免费预览(第 5/5 页)
DEA-C01(AWS Certified Data Engineer Associate (DEA-C01))最新题库第 41–50 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 306 题。
第 41 题 · 题号 297 · 单选
一个数据工程师需要部署一个复杂的管道。该管道的各个阶段必须能够运行脚本。数据工程师必须在管道中仅使用完全托管和无服务器的服务。哪种解决方案能够满足这些要求?
- A. 部署 AWS Glue 任务和工作流。使用 AWS Glue 按计划运行任务和工作流。
- B. 使用 Amazon Managed Workflows for Apache Airflow (Amazon MWAA) 构建和调度管道。
- C. 将脚本部署到 Amazon EC2 实例。使用 Amazon EventBridge 按计划运行脚本。
- D. 使用 AWS Glue DataBrew 构建管道。使用 Amazon EventBridge 按计划运行管道。
答案: A
第 42 题 · 题号 298 · 单选
一家公司需要实施数据网格架构,其中交易、风险和合规团队的域各自拥有自己的数据。各团队需要相互共享特定视图。这些团队在 AWS Glue 数据目录中拥有超过 1,000 张表,分布在 50 个数据库中。三个团队都使用 Amazon Athena 执行按需分析。各团队使用 Amazon Redshift 生成复杂报告。合规团队必须审计所有数据访问。对个人身份信息 (PII) 数据的访问必须受到限制。该公司需要一个可扩展的解决方案来满足团队需求。该解决方案必须提供跨团队域执行分析的能力。哪种解决方案能够满足这些要求?
- A. 在 Athena 中创建视图以进行按需分析。在 Amazon Redshift 中使用 Athena 视图以执行跨域分析。使用 AWS CloudTrail 审计数据访问。使用 AWS Lake Formation 建立精细的访问控制。
- B. 使用 AWS Glue Data Catalog 视图执行分析。
使用 AWS CloudTrail 日志审计数据访问。
使用 AWS Lake Formation 管理访问权限。
使用安全定义者视图来屏蔽个人身份信息(PII)。
- C. 使用 AWS Lake Formation 设置跨域表格访问。设置细粒度的访问控制。
- D. 为每个域创建物化视图并启用 Amazon Redshift 数据共享。配置跨域访问策略。
答案: A
解析: 选项 A 是满足所有要求的最全面的解决方案。它使用 Athena 视图进行跨域按需分析,并使这些视图能够从 Amazon Redshift 中查询以执行复杂的跨域分析。AWS CloudTrail 提供合规团队所需的审计功能,AWS Lake Formation 提供细粒度的访问控制以限制对 PII 数据的访问。该解决方案利用 AWS 原生服务构建了一个可扩展的数据网格架构,既支持 Athena(按需分析)又支持 Redshift(复杂报表)用例,同时保持了适当的访问控制和审计功能。
第 43 题 · 题号 299 · 单选
一家公司拥有一个实时处理交易数据的数据管道。该公司需要一个通知系统,能够根据处理错误的类型无延迟地提醒不同的团队。对于安全相关的错误,系统必须立即通知安全团队。对于数据验证错误,系统必须通知数据质量团队。对于系统错误,系统必须通知运维团队。哪种解决方案能够以最低的运营开销满足这些要求?
- A. 创建一个 Amazon Simple Notification Service (Amazon SNS) 主题,并将 AWS Lambda 函数作为订阅者,该函数用于评估错误类型,并将错误转发至相应的电子邮件地址。
- B. 为每种错误类型配置具有不同事件模式的 Amazon EventBridge 规则。将每种错误类型路由到专用的 Amazon Simple Notification Service (Amazon SNS) 主题,以便向特定团队发送告警。
- C. 使用 Amazon Simple Queue Service (Amazon SQS) 与消息属性来对错误进行分类。允许每个团队轮询他们各自的 SQS 队列以获取相关错误。
- D. 为每种错误类型设置具有不同指标的 Amazon CloudWatch 警报。每次超过指标阈值时,调用不同的 Amazon Simple Notification Service (Amazon SNS) 通知。
答案: B
解析: 选项B使用Amazon EventBridge为每种错误类型配置不同的事件模式,并将它们路由到专用的SNS主题以发送团队特定的通知。EventBridge原生支持实时事件过滤和路由,不需要像选项C中的SQS那样轮询,也不需要像选项A中的Lambda那样额外的计算层。它是一个完全托管的无服务器解决方案,操作开销最小。选项D中的CloudWatch警报是为指标阈值违规设计的,不适用于实时交易错误处理,并且需要更多的配置和管理。选项C使用SQS轮询会引入延迟,与'无任何延迟'的要求相矛盾。EventBridge可直接与数据管道事件集成,SNS通过其专用主题向每个团队提供即时通知。
第 44 题 · 题号 300 · 单选
一位数据工程师正在为一个需要持续摄取数据的应用程序设计日志表。该应用程序必须为其他应用程序提供可靠的、基于 API 的特定记录访问能力。该应用程序必须能够每秒处理超过 4,000 次并发写操作和 6,500 次读操作。哪种解决方案能够满足这些要求?
- A. 创建一个使用 KEY 分配样式的 Amazon Redshift 表。使用 Amazon Redshift Data API 执行所有读写操作。
- B. 将日志文件存储在 Amazon S3 Standard 存储桶中。在 AWS Glue 数据目录中注册架构。创建一个指向 AWS Glue 架构的外部 Redshift 表。使用该表执行 Amazon Redshift Spectrum 读取操作。
- C. 创建一个使用 EVEN 分配风格的 Amazon Redshift 表。使用 Amazon Redshift Java 数据库连接 (JDBC) 连接器建立数据库连接。使用该数据库连接执行所有读取和写入操作。
- D. 创建一个 Amazon DynamoDB 表,该表具有预置容量以满足应用程序的容量需求。使用该 DynamoDB 表并通过 DynamoDB API 执行所有读写操作。
答案: D
解析: 选择D(使用预置容量的Amazon DynamoDB)是正确答案,原因如下:1)基于API的访问要求 - DynamoDB通过DynamoDB API提供原生基于API的访问,直接满足了对特定记录进行可靠的基于API访问的要求;2)高并发要求 - DynamoDB专门设计用于处理大规模并发操作,可以轻松支持每秒超过4,000次并发写入和6,500次读取;3)特定记录访问 - DynamoDB使用主键提供对特定记录的快速直接访问,这非常适合日志表场景;4)持续摄取 - DynamoDB凭借其可扩展的架构可以很好地处理持续摄取。相比之下,Amazon Redshift(选项A和C)是针对分析查询优化的数据仓库,而不是高并发的OLTP工作负载,并且在并发连接方面存在限制。选项B使用S3和Redshift Spectrum是针对大型数据集的分析查询设计的,而不是用于高频事务操作。
第 45 题 · 题号 301 · 单选
一家公司使用 AWS Glue ETL 管道来处理数据。该公司使用 Amazon Athena 来分析 Amazon S3 存储桶中的数据。为了更好地了解运输时间表,该公司决定除了订单数据之外,还收集和存储运输和交付日期。该公司添加了一项数据质量检查,以确保运输日期晚于订单日期,并且交付日期晚于运输日期。未通过质量检查的订单必须存储在第二个 S3 存储桶中。哪种解决方案能以最具成本效益的方式满足这些要求?
- A. 使用 AWS Glue DataBrew DATEDIFF 函数创建两个额外的列。检查新列。
- B. 使用 Athena 查询所有三个日期列,并比较这些列。
- C. 使用 AWS Glue Data Quality 创建一个使用三个日期列的自定义规则。
- D. 使用 AWS Glue 爬虫来填充 AWS Glue 数据目录。使用三个日期列来创建筛选条件。
答案: C
解析: AWS Glue Data Quality 是专门用于在 AWS Glue ETL 管道中创建数据质量规则的解决方案。它允许创建跨多个列的自定义规则(在本例中是比较 order_date、shipping_date 和 delivery_date),并且可以将失败的记录分离到不同的目标位置(第二个 S3 存储桶)。选项 A 使用的是 DataBrew,这是一个独立的可视化数据准备服务,成本较高。选项 B 使用的是 Athena,用于查询和分析,不适合用于 ETL 数据质量验证。选项 D 使用的是爬虫程序(crawler),用于模式发现,不能进行质量检查。Glue Data Quality 集成在 Glue 作业中,使其成为此场景中性价比最高的选择。
第 46 题 · 题号 302 · 单选
一家公司正在开发机器学习(ML)模型。数据工程师需要对训练数据应用数据质量规则。该公司将训练数据存储在 Amazon S3 存储桶中。哪种解决方案能够以最少的运营开销满足这些要求?
- A. 创建一个 AWS Lambda 函数,用于检查数据质量并在代码中抛出异常。当数据被添加到 S3 存储桶时运行该函数。为代码中的异常创建一个 Amazon CloudWatch 警报。
- B. 为 S3 存储桶中的数据创建一个 AWS Glue DataBrew 项目。为数据质量规则创建一个规则集。创建一个分析任务以运行数据质量规则。使用 Amazon EventBridge 在数据添加到 S3 存储桶时运行该分析任务。
- C. 创建一个 Amazon EMR 预置集群。将 Python 开源数据质量包添加到 EMR 集群。使用该 Python 包编写数据质量规则代码,并将数据从 S3 存储桶复制到 EMR 集群。将数据从 S3 存储桶复制到 EMR 集群。运行数据质量规则。
- D. 创建 AWS Lambda 函数以评估数据质量规则。使用 AWS Step Functions 编排工作流,在数据不符合数据质量规则时发布通知。
答案: B
解析: AWS Glue DataBrew 是一项完全托管的无服务器可视化数据准备服务,专为数据质量检查和数据转换任务而设计。它允许数据工程师通过可视化界面定义数据质量规则集,而无需编写自定义代码。当新数据到达 S3 存储桶时,可以通过 Amazon EventBridge 自动触发分析任务,从而无需人工干预。与需要编写和维护 Lambda 函数的选项 A 和 D,以及需要预置和管理 EMR 集群的选项 C 相比,Glue DataBrew 是完全托管且专为数据质量检查而构建的,因此运营开销最低。
第 47 题 · 题号 303 · 单选
一位数据工程师正在配置一个 AWS Glue Apache Spark 提取、转换和加载 (ETL) 作业。该作业包含对两个大型且大小相等的数据框进行排序合并连接。该作业失败并出现以下错误:设备上没有剩余空间。哪种解决方案可以解决此错误?
- A. 使用 AWS Glue Spark 随机数洗牌管理器。
- B. 为作业部署 Amazon Elastic Block Store(Amazon EBS)卷以供使用。
- C. 将该作业中的排序合并连接转换为广播连接。
- D. 将DataFrames转换为DynamicFrames,并在作业中执行DynamicFrame连接。
答案: A
解析: AWS Glue Spark Shuffle Manager 插件专门用于解决在大型 shuffle 操作(如 sort-merge join)过程中出现的“没有可用设备空间”错误。默认情况下,Spark 将 shuffle 数据写入工作节点的本地磁盘,在处理大型数据集时本地磁盘可能会被占满。AWS Glue Spark Shuffle Manager 会将这些 shuffle 数据卸载到 Amazon S3,从而消除本地磁盘空间的限制。选项 B 不可行,因为 AWS Glue 是一种无服务器服务,不支持挂载自定义 EBS 卷。选项 C 不合适,因为广播连接适用于将大型 DataFrame 与小型 DataFrame 相连,而不是两个同样大的 DataFrame(那样会导致内存耗尽)。选项 D 也不能解决 shuffle 操作期间的底层磁盘空间问题。
第 48 题 · 题号 304 · 多选
一位数据工程师正在使用 Apache Iceberg 框架构建一个包含 100 TB 数据的数据湖。该数据工程师希望运行使用 Iceberg 框架的 AWS Glue Apache Spark 作业。哪些步骤组合可以满足这些要求?(选择两项)
- A. 为 AWS Glue 作业创建一个名为 --conf 的键。为 --datalake-formats 作业参数将 Iceberg 设置为值。
- B. 通过使用 -extra-jars 作业参数指定特定版本 Iceberg 的路径。将 Iceberg 设置为 datalake-formats 作业参数的值。
- C. 将 Iceberg 设置为 --datalake-formats 作业参数的值。
- D. 将 --enable-auto-scaling 参数设置为 true。
- E. 将 --job-bookmark-option: job-bookmark-enable 参数添加到 AWS Glue 作业中。
答案: C, D
第 49 题 · 题号 305 · 单选
一家公司的数据工程师正在优化提取、转换和加载 (ETL) 工作流。当前的架构使用 Amazon EMR 和 Apache Spark 进行大规模转换,并使用 AWS Glue 处理其他 ETL 任务。这些工作流将处理后的数据加载到基于 Amazon S3 的数据湖中。该公司希望迁移到一个完全托管的无服务器解决方案,该方案能够编排多个 ETL 作业并自动化执行。新解决方案必须继续使用 Spark 来处理数据。公司需要以最少的人工干预来编排和自动化 ETL 工作流。哪种解决方案能够满足这些要求?
- A. 将所有 ETL 作业迁移到 AWS Glue。使用 AWS Glue 工作流来编排管道。
- B. 配置 AWS Step Functions 和 Amazon EventBridge,以编排和调用 AWS Glue 和 Amazon EMR 中的 ETL 工作流。
- C. 配置 AWS Lambda 函数来处理 Amazon S3 事件通知,以便在上传新数据时执行数据转换任务。
- D. 使用 Amazon Managed Workflows for Apache Airflow 自动调度来编排基于 Spark 的 ETL 作业。
答案: A
第 50 题 · 题号 306 · 单选
一家公司为客户生成年度财务报表,并将这些报表存储在 Amazon S3 存储桶中。客户在 1 周后很少访问这些文档。公司必须将这些报表保留 7 年,并且这些报表必须能够随时供客户访问。哪种解决方案能以最具成本效益的方式满足这些要求?
- A. 创建一个 S3 生命周期规则,将对象在 7 天后转换至 S3 Glacier Deep Archive,并在 7 年后使其过期。
- B. 设置S3存储桶在上传新对象时使用S3智能分层。设置对象在7年后过期。
- C. 创建 S3 生命周期规则,在 7 天后将对象转换至 S3 Glacier 即时检索存储层,并在 7 年后使对象过期。
- D. 将S3存储桶设置为在上传新对象时使用S3 Glacier即时检索。创建一个每日运行的AWS Lambda函数,用于删除所有超过7年的对象。
答案: C
解析: 选项C是最经济实惠且满足所有要求的解决方案。S3 Glacier Instant Retrieval提供毫秒级检索时间,满足'随时可访问'的要求,同时在长期存储方面比S3 Standard便宜得多。在频繁访问期结束后,7天后过渡到Glacier Instant Retrieval,然后7年后过期,这与所述访问模式最佳匹配。选项A(Deep Archive)失败,因为检索需要12-48小时,不是'随时可访问'。选项B(Intelligent-Tiering)会产生每个对象的监控费用,对于此类可预测的访问模式来说成本更高。选项D不是最优的,因为它立即将新对象放入更昂贵的Glacier Instant Retrieval中,而不是在初始高访问期使用更便宜的S3 Standard。