DEA-C01 题库 · 最新 50 题免费预览(第 4/5 页)
DEA-C01(AWS Certified Data Engineer Associate (DEA-C01))最新题库第 31–40 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 306 题。
第 31 题 · 题号 287 · 单选
一家法律公司正在构建一个数据管道,以支持一个将在工作时间处理高峰流量的应用程序。该应用程序将提供相关法律和可用律师的信息。法律文档数据库将每天更新一次。该应用程序必须从日历数据库显示最新的律师可用性信息,并提供对法律文档的复杂全文搜索功能。该公司希望使用 AWS Glue 进行提取、转换和加载 (ETL) 流程。律师可用性信息必须在任何日程变更发生后的 5 分钟内保持最新。哪种解决方案能够以最少的运营开销来满足这些要求?
- A. 使用 AWS Step Functions 来编排 AWS Glue 作业,并采用基于时间和基于事件的触发器。将处理后的数据存储在 Amazon S3 中。使用 Amazon RDS 实现搜索功能。
- B. 使用 AWS Step Functions 通过基于时间的触发器和基于事件的触发器来编排 AWS Glue 作业。将处理后的数据存储在 Amazon S3 中。使用 Amazon OpenSearch Service 提供全文搜索功能。
- C. 使用带有基于时间的触发器和基于事件的触发器的AWS Glue工作流。将处理后的数据存储在Amazon DynamoDB中。通过使用AWS Lambda函数创建自定义搜索解决方案。
- D. 使用 Amazon EventBridge 来调度所有 AWS Glue 作业。将处理后的数据存储在 Amazon RDS 中。使用 Amazon Kendra 实现全文搜索功能。
答案: B
解析: 选项 B 是最佳选择,因为它使用 AWS Step Functions 通过基于时间的触发器(用于每日法律文档更新)和基于事件的触发器(用于在 5 分钟内捕获律师可用性变化)来编排 AWS Glue 作业。将处理后的数据存储在 Amazon S3 中具有成本效益,并且与管道很好地集成。Amazon OpenSearch Service 是一项托管服务,专为复杂的全文搜索功能而设计,可满足以最少运营开销搜索法律文档的要求。选项 A 使用不针对全文搜索优化的 RDS。选项 C 需要使用 Lambda 构建自定义搜索解决方案,这会增加运营开销。选项 D 使用 Amazon Kendra(专为机器学习驱动的企业搜索而设计,而不是复杂的全文搜索)和 RDS,这将增加更多的运营复杂性。
第 32 题 · 题号 288 · 单选
一个数据工程师需要部署一个无服务器数据管道。在该管道中,CSV 文件被上传到 Amazon S3 存储桶,该存储桶会调用一个 AWS Lambda 函数。该 Lambda 函数将 CSV 文件转换为 JSON 格式,并将结果存储到第二个 S3 存储桶中。数据工程师已经创建了一个包含该 Lambda 函数的 AWS 无服务器应用程序模型 (AWS SAM) 模板。该数据工程师希望使用 AWS SAM 进行管道部署。哪种解决方案将打包并部署这个无服务器数据管道?
- A. 将第一个 S3 存储桶和 Lambda 函数的 S3 事件源添加到 SAM 模板中。运行 sam build 命令以准备部署包。运行 sam deploy --guided 命令以部署管道。
- B. 直接使用 --s3-bucket 参数运行 sam deploy 命令来部署 Lambda 函数代码。在 AWS 管理控制台中手动配置 S3 事件触发器。
- C. 将第一个 S3 存储桶添加到 SAM 模板中。运行 sam package 模板以将 Lambda 函数代码上传到 Amazon S3。从打包后的模板创建 AWS CloudFormation 堆栈。手动配置事件通知。
- D. 将第一个 S3 存储桶和 Lambda 函数的 S3 事件源添加到 SAM 模板中。运行 sam build 命令,然后运行 aws cloudformation deploy 命令来部署管道。
答案: A
解析: 选项A是正确答案,因为它遵循了AWS SAM打包和部署无服务器应用程序的标准工作流程。它在SAM模板中包含了S3存储桶和Lambda函数的S3事件源(基础设施即代码),使用'sam build'准备部署包,并使用'sam deploy --guided'以交互方式部署应用程序,这是SAM特定的部署命令。选项B不正确,因为它需要在控制台中进行手动配置,未能充分利用SAM的基础设施即代码功能。选项C已过时,因为'sam package'已被'sam build'+'sam deploy'取代,而且它还需要手动配置事件通知。选项D虽然可以工作,但使用了'aws cloudformation deploy'而不是更SAM特定的'sam deploy'命令,因此与AWS SAM工作流程的契合度较低。
第 33 题 · 题号 289 · 单选
一家公司将对象存储在 Amazon S3 存储桶中。该公司爬取这些对象,以便 Amazon Athena 可以查询数据。一位数据工程师手动将所有对象从路径前缀为 status=01 的分区移到了前缀 status=02 下。status=01 分区位置现在为空。但是,status=01 分区位置仍然出现在 AWS Glue Data Catalog 元数据中。数据工程师应该运行哪个 Athena 命令来解决元数据不一致的问题?
- A. MSCk 修理表
- B. 删除分区
- C. 修改表设置表属性
- D. 修改表 修改列
答案: B
解析: 数据工程师手动将所有对象从 status=01 分区移动到了 status=02 分区,导致 status=01 分区位置为空。但是,status=01 分区仍然出现在 AWS Glue Data Catalog 元数据中。为了解决这个不一致问题,数据工程师需要从元数据中移除 status=01 分区。MSCK REPAIR TABLE 命令只会为文件系统中存在但目录中缺失的分区添加元数据,而不会从目录中删除现有分区。ALTER TABLE SET TBLPROPERTIES 用于设置表属性,ALTER TABLE CHANGE COLUMN 用于修改列定义。因此,正确的命令是 ALTER TABLE DROP PARTITION,它会显式地从 Glue Data Catalog 元数据中删除 status=01 分区。
第 34 题 · 题号 290 · 单选
一家公司使用 Amazon Redshift 作为其数据仓库。一名数据工程师必须查询一个名为 orders.complete_orders_history 的表,该表包含 100 个列。查询必须返回除 companyId 和 unique_system_id 列之外的所有列。哪种 Amazon Redshift SQL 语句可以满足此要求?
- A. 请提供需要翻译的英文内容。
- B. 请提供需要翻译的英文内容,我才能为您进行翻译。
- C. 请提供需要翻译的英文内容。
- D. 请提供需要翻译的英文内容。
答案: A
第 35 题 · 题号 291 · 单选
一家制造公司使用 AWS Glue 任务处理物联网传感器数据,以生成预测性维护模型。数据工程师需要实施自动化数据质量检查,以识别超出 -50°C 到 150°C 预期范围的温度读数。数据质量检查还必须识别缺少时间戳值的记录。数据工程师需要一种需要最少编码且能自动标记指定问题的解决方案。哪种解决方案能满足这些要求?
- A. 创建一个 AWS Glue DataBrew 项目来分析传感器数据。为时间戳定义完整性规则。为温度值设置数值范围验证。
- B. 使用 AWS Glue 的数据质量规则和基于机器学习 (ML) 的异常检测功能,来识别缺失的时间戳并检测温度异常。
- C. 创建一个 AWS Lambda 函数来扫描传感器数据文件,以验证温度范围。使用 AWS Glue Data Catalog 表来检查时间戳的完整性。
- D. 创建一个使用自定义数据质量运算符来分析传感器数据的 AWS Glue DynamicFrame。使用 Amazon SageMaker Data Wrangler 转换来验证时间戳和温度范围。
答案: A
解析: 选项A是正确的答案。AWS Glue DataBrew是一个可视化数据准备工具,只需极少代码即可使用,非常适合此场景。它允许数据工程师对传感器数据进行剖析,定义完整性规则以识别缺失的时间戳值,并设置数值范围验证以标记超出-50°C至150°C范围的温度读数。这满足了所有要求:最少编码、自动标记数据质量问题,以及验证温度范围和时间戳完整性。选项B是不正确的,因为它依赖基于机器学习的异常检测来处理温度问题,这检测的是统计异常值,而不是明确的业务定义范围。选项C需要自定义Lambda函数代码,违反了最少编码的要求。选项D过于复杂,涉及自定义DynamicFrame运算符和SageMaker Data Wrangler,需要大量编码和配置。
第 36 题 · 题号 292 · 单选
两个数据工程团队使用不同的 AWS 账户。两个团队都请求访问位于第三个 AWS 账户中 Amazon Redshift 集群上的同一个数据共享。该数据共享名为 salesshare。一名数据工程师必须使用 Amazon Redshift SQL 接口来授予两个数据工程团队对该数据共享的访问权限。哪些命令能够满足此要求?
- A. 授予对数据共享 sales 的使用权限给账户 '' 和 '';
- B. 授权对数据共享 salesshare 的使用权限给命名空间 '' 和 ''。
- C. 授予账户对数据共享 salesshare 的使用权限;
- D. 授权对数据共享 salesshare 的使用权给命名空间 '';
答案: C
解析: 正确答案是C。在 Amazon Redshift 中,当为多个 AWS 账户授予 datashare 访问权限时,需要为每个账户使用单独的 GRANT 语句。选项 A 使用了错误的语法——Redshift 使用 ACCOUNT 关键字(单数),而不是 ACCOUNTS,正确的分隔符是逗号而不是 AND。选项 B 和 D 使用了 NAMESPACES,这是不正确的,因为命名空间用于同一个 AWS 账户内,而不是跨不同账户。由于两个数据工程团队位于不同的 AWS 账户中,选项 C 是正确的方法,使用两个单独的 GRANT USAGE 语句,每个账户一个。
第 37 题 · 题号 293 · 单选
一家公司每晚在 Amazon EMR 集群中运行一个 Apache Spark 应用程序。该公司使用 Amazon EC2 实例为 EMR 集群提供计算容量。该公司在集群模式下部署了 Spark 应用程序。Spark 应用程序中发生了一个错误。错误日志存储在应用程序的 Spark driver 标准错误日志中。一名数据工程师需要调查此错误。数据工程师可以在哪里找到此错误日志?
- A. 工程师可以连接到实时集群上的 Web UI,以查看 YARN ResourceManager 日志。
- B. 工程师可以连接到持久化应用 UI,在 Spark UI 中查看第一个 YARN 容器的日志。
- C. 工程师可以连接 Amazon EMR 控制台,查看归档在 Amazon S3 中的 Amazon EMR 步骤日志。
- D. 工程师可以通过使用 SSH 连接到集群的主节点来查看 Spark 历史服务器的日志。
答案: B
解析: 在 Spark 集群模式下,Spark 驱动程序运行在 YARN 容器中。其标准错误输出会与该容器的日志一起被收集,并可在持久化的 Spark 应用程序 UI 中查看。YARN ResourceManager 日志只包含集群级信息,EMR 步骤日志可能不会包含完整的驱动程序错误日志,而 Spark History Server 自身的日志也不是应用程序驱动程序的错误日志。
第 38 题 · 题号 294 · 单选
一家公司需要构建一个数据管道,用于处理来自 Amazon S3 存储桶的 1 TB 文件。该管道需要根据业务逻辑创建三个 DataFrame。该管道必须将所有三个 DataFrame 并行保存到另一个 S3 存储桶中。公司需要将该管道设置为 Amazon EventBridge 规则的目标,该规则匹配源 S3 存储桶中的文件上传事件。哪种解决方案能够以最少的维护开销满足这些要求?
- A. 在 Amazon EMR 上配置一个 Apache Spark Streaming 应用程序,以批量方式处理来自 S3 源存储桶的数据,创建 DataFrame,并将输出保存到目标 S3 存储桶。
- B. 配置三个 AWS Lambda 函数来处理业务逻辑,并将 DataFrames 并行保存到目标 S3 存储桶。
- C. 配置一个 AWS Glue 工作流,以并行运行三个 AWS Glue 作业来处理该文件。
- D. 配置一个 AWS Step Functions 状态机,以启动一个 AWS Glue 工作流,从而并行运行三个 AWS Glue 作业来处理该文件。
答案: C
解析: 选项C是最佳选择,因为AWS Glue是一个无服务器的ETL服务,需要最少的维护开销。AWS Glue工作流可以编排三个Glue作业并行运行,处理大型数据文件(1-TB完全在Glue的处理能力范围内),并且可以直接由Amazon EventBridge规则触发。选项A(EMR)需要更多维护,因为您需要管理集群、打补丁和扩展。选项B(Lambda)由于执行时间限制和资源限制,处理1-TB文件不切实际。选项D(Step Functions + Glue工作流)增加了额外的编排层,造成不必要的复杂性,增加了维护开销。
第 39 题 · 题号 295 · 单选
一家公司需要一个解决方案来存储和查询具有可变属性的产品数据。该解决方案必须支持不可预测且高容量的查询,并具有个位数毫秒级的延迟,即使在突然的流量高峰期间也是如此。该解决方案必须通过名为"产品ID"的主标识符来检索项目。该解决方案必须允许通过名为"类别"和"品牌"的次要属性进行灵活查询。哪种解决方案能满足这些要求?
- A. 使用具有按需容量的 Amazon DynamoDB 表来存储产品数据。按主键存储产品。使用全局二级索引 (GSI) 来存储二级属性。
- B. 使用 Amazon Aurora 多可用区部署来存储产品数据。使用只读副本。为主要和次要属性创建索引。
- C. 使用具有动态扩展能力的 Amazon OpenSearch Serverless 集群来存储产品数据,并按主要和次要属性对产品数据进行索引。
- D. 使用 Amazon ElastiCache (Redis OSS) 和 Amazon S3 存储产品数据。使用 Amazon Athena 运行灵活的二级属性查询。
答案: A
解析: 选择A(Amazon DynamoDB搭配按需容量模式)是最佳方案,原因如下:1)按需容量模式可以自动处理不可预测的流量峰值,无需人工干预;2)在任何规模下都能提供个位数毫秒的延迟,满足性能要求;3)DynamoDB是NoSQL数据库,其灵活的数据模型天然支持产品属性的可变性,无需修改表结构;4)通过主键可以高效检索Product ID;5)全局二级索引(GSI)支持针对Category和Brand等二级属性的灵活查询。其他选项的问题:选项B(Aurora)需要固定表结构,且难以应对突发流量;选项C(OpenSearch Serverless)的延迟通常高于个位数毫秒;选项D(ElastiCache + Athena)中Athena查询S3的响应时间无法达到个位数毫秒级别。
第 40 题 · 题号 296 · 单选
公司必须将特定数据保留 1 年。一名数据工程师发现,公司的某个 Amazon S3 存储桶中包含数百万个超过 3 年的对象。该存储桶已启用版本控制。为降低成本,数据工程师实施了一条 S3 生命周期规则,使对象在 365 天后过期。新的 S3 生命周期规则导致对象数量翻倍,而不是减少。数据工程师还必须采取哪项操作才能永久删除旧对象?
数据工程师必须添加一条生命周期规则,使旧对象的非当前版本过期。
- A. 禁用 S3 存储桶上的版本控制。
- B. 使用 AWS Lambda 函数运行 Python 任务,以识别并删除超过 365 天的对象。
- C. 暂停 S3 存储桶的版本控制。
- D. 添加一个额外的 S3 生命周期规则,以删除超过 365 天的对象的当前版本和过期版本。
答案: D
解析: 当S3存储桶启用了版本控制后,仅将当前对象过期的生命周期规则只会创建删除标记(delete marker),而对象的先前版本仍会作为非当前版本(noncurrent version)保留在存储桶中。这就是对象数量翻倍的原因——当前版本被添加了删除标记,但所有先前的版本仍然存在。要永久删除旧对象,数据工程师需要一条额外的生命周期规则,明确删除对象的非当前版本。选项D通过添加一条规则来删除超过365天的当前版本和过期版本,正确地解决了这个问题。选项A和C(禁用或暂停版本控制)不会删除现有的非当前版本。选项B(使用Lambda函数)不是托管解决方案,与原生的S3生命周期规则相比会增加运维负担。