DEA-C01 题库 · 最新 50 题免费预览(第 1/5 页)
DEA-C01(AWS Certified Data Engineer Associate (DEA-C01))最新题库第 1–10 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 306 题。
第 1 题 · 题号 257 · 单选
一所大学正在开发一款用于分析学生论文的教育应用程序。该应用程序能够提供个性化反馈,并精确引用大学的教材内容。该应用程序需要处理多种语言的论文。其回复必须包含对教材特定章节的直接引用,并且必须使用学生所选的语言。哪种解决方案能在满足这些要求的同时带来最小的运营开销?
- A. 使用 Amazon OpenSearch Serverless 构建自定义向量数据库。将教材内容存储为多语言嵌入。创建一个 AWS Lambda 函数,在使用 Amazon Bedrock 生成响应时对数据库进行排队。
- B. 在 Amazon Bedrock 知识库中使用该大学的教材创建知识库。配置一个多语言模型,以生成带有来源引用的回答。
- C. 使用 Amazon Comprehend 检测作文的语言和关键主题。使用 Amazon Kendra 搜索相关的教科书段落。创建一个 AWS Lambda 函数,将教科书段落格式化为反馈。
- D. 使用 Amazon SageMaker 托管一个经过定制训练的大型语言模型(LLM),该模型已根据该大学的教材进行了微调,以生成带有引文的个性化反馈。
答案: C
第 2 题 · 题号 258 · 单选
一家媒体公司将大型视频文件上传到 Amazon S3 进行处理。处理完成后,公司需要保留原始文件 90 天,以防文件需要重新处理。90 天后,公司可以删除这些文件以降低存储成本。公司将处理后的视频存储在另一个 S3 存储桶中。哪种 S3 生命周期配置能够以最具成本效益的方式满足原始文件的这些要求?
- A. 将文件存储在 S3 Standard 中 90 天。然后将文件转换到 S3 Glacier Flexible Retrieval 进行长期存储,最后让文件过期。
- B. 将文件存储在 S3 Standard 中保留 90 天。启用版本控制。对这些文件启用对象锁定期 90 天。然后使这些文件过期。
- C. 将文件存储在 S3 Standard 中 90 天。实施 S3 生命周期管理以使文件过期。
- D. 将文件存储在 S3 Intelligent-Tiering 中 90 天。启用版本控制。添加 S3 生命周期管理以使文件过期。
答案: C
解析: 选项C是最具成本效益的解决方案。需求仅需要在S3 Standard中存储文件90天然后删除。S3生命周期管理可以直接在90天后过期(删除)这些文件,无需不必要的过渡或其他功能。选项A很浪费,因为过渡到S3 Glacier Flexible Retrieval会产生检索成本和最短存储时长费用,而文件反正会被删除,所以这是不必要的。选项B增加了版本控制和对象锁定的复杂性和成本,而对象锁定实际上会阻止删除(与需求相矛盾)。选项D使用智能分层会产生每个对象的监控费用,并且版本控制会增加额外的存储成本。由于文件将在90天后删除,因此不需要过渡到更便宜的存储——只需要一个简单的过期策略即可。
第 3 题 · 题号 259 · 多选
一位数据工程师正在构建一个无服务器的多步骤提取、转换和加载(ETL)管道。该管道从 Amazon S3 数据湖中提取数据,并使用 AWS Glue ETL 作业对数据进行转换,然后将结果加载到 Amazon Redshift 数据库中。该数据工程师需要编排此无服务器 ETL 工作流程。哪些解决方案能够满足这些要求?(请选择两项。)
- A. 使用 AWS Step Functions 实现工作流程。配置 Step Functions 以协调 AWS Glue ETL 作业,并通过自动重试处理错误情况。
- B. 使用 AWS Glue 工作流创建一个 ETL 任务图,直观地展示作业与作业触发器之间的依赖关系。
- C. 配置一个始终运行的 Amazon EC2 实例。创建一个 cron 作业,根据预定义的计划按顺序调用 AWS Glue ETL 作业。
- D. 使用 Amazon EventBridge 规则,根据 S3 对象创建事件调用 AWS Glue ETL 作业。配置这些规则以按顺序串联 AWS Glue ETL 作业,并处理复杂的作业依赖关系。
- E. 构建一个编排解决方案,使用 AWS CodePipeline 根据依赖关系协调 ETL 管道和基础设施变更。
答案: A, B
解析: 选项A(AWS Step Functions)是理想选择,因为它是一个无服务器编排服务,专门设计用于协调多步骤工作流,并内置错误处理和自动重试功能。选项B(AWS Glue workflows)也是正确的,因为AWS Glue工作流是为编排Glue ETL任务而原生设计的,可以直观地展示任务之间的依赖关系和触发器。这两个选项都满足无服务器的要求。选项C不正确,因为EC2实例不是无服务器的。选项D有局限性,因为EventBridge更适合简单的事件驱动触发器,而不是具有依赖关系的复杂多步骤ETL编排。选项E不正确,因为CodePipeline是为CI/CD流水线设计的,而不是用于ETL工作流编排。
第 4 题 · 题号 260 · 单选
一家公司需要通过连接存储在 Amazon DynamoDB、Amazon RDS、Amazon Redshift 和 Amazon S3 中的数据来生成一次性性能报告。该公司希望避免不必要的数据移动,并尽量缩短查询执行时间。哪种解决方案能满足这些要求?
- A. 通过 DynamoDB Streams 从 DynamoDB 捕获数据。使用 AWS DMS 从 Amazon RDS 迁移数据。导出 Amazon Redshift 数据。将所有数据存储在 Amazon S3 中。使用 Redshift Spectrum 运行查询。
- B. 设置一个 AWS Glue ETL 管道,用于在 Amazon S3 中提取、转换和集中存储数据。使用 Amazon Athena 运行分析查询。
- C. 部署一个由 Apache Spark 提供支持的 Amazon EMR 集群,以从多个来源摄取、处理和合并数据集。然后对合并后的数据运行分析工作负载。
- D. 使用 Amazon Athena 联合查询在 DynamoDB、Amazon RDS、Amazon Redshift 和 Amazon S3 之间执行一次性连接和分析。
答案: D
解析: Amazon Athena Federated Query是最佳解决方案,因为它允许直接从多个数据源(DynamoDB、RDS、Redshift和S3)查询数据,而无需移动或复制数据。这种方法最大限度地减少了数据移动,这对于一次性性能报告至关重要。联合查询使用数据源连接器在数据所在位置执行查询,从而降低了数据传输成本和查询执行时间。与选项A、B和C不同,这些选项都需要将数据提取、转换并集中到单个存储(S3)中,而Athena联邦查询消除了不必要的数据移动,同时仍提供跨异构数据源执行连接的能力。这使其成为对避免数据移动和最小化查询时间有严格要求的一次性分析任务的最佳选择。
第 5 题 · 题号 261 · 单选
某公司每天处理一个包含数百万条交易记录的 CSV 文件。该文件存储在 Amazon S3 中。在更新数据库之前,必须对每条交易进行验证。公司需要一种能够并行处理数据的解决方案。该解决方案必须使用错误处理机制:如果超过 15% 的记录未通过验证,则停止整个处理过程。哪种解决方案能够以最低的运维开销满足这些要求?
- A. 创建一个 AWS Batch 作业,使用自定义错误跟踪机制并行处理文件的各个分块。
- B. 使用 AWS Step Functions 分布式 Map 状态,并将 ToleratedFailurePercentage 字段设置为 15%。
- C. 部署一个带有 Spark 的 Amazon EMR 集群来处理该文件,并将自定义故障阈值配置为 15%。
- D. 使用 AWS Lambda 与 S3 批量操作来处理文件,并跟踪验证失败率使其低于 15%。
答案: B
解析: AWS Step Functions 分布式 Map 状态专门设计用于并行处理存储在 S3 中的大型数据集(数百万条记录)。它通过 ToleratedFailurePercentage 字段提供内置的错误处理功能,当失败率超过阈值时会自动停止执行。作为完全托管的服务,与 AWS Batch(需要管理计算环境)、Amazon EMR(需要集群管理)或带 S3 Batch Operations 的 AWS Lambda(在处理大型数据集方面有限制且需要自定义错误跟踪)相比,它所需的运维开销最小。
第 6 题 · 题号 262 · 单选
一家公司需要为Amazon RDS for MySQL数据库收集日志,并使这些日志可供审计使用。这些日志必须跟踪修改数据库中数据的每个用户或对数据库实例进行更改的用户。哪种解决方案能满足这些要求?
- A. 启用 Amazon CloudWatch Logs。创建指标过滤器以监控数据库变更和实例级变更。配置自动化通知系统,以便在可疑数据库操作发生时发送近乎实时的警报。
- B. 配置一个 Amazon EventBridge 规则来监控数据库活动。创建一个 AWS Lambda 函数来处理 EventBridge 事件并将其存储到 Amazon OpenSearch Service 中。
- C. 配置 AWS CloudTrail 以记录 API 调用。使用 Amazon CloudWatch Logs 进行基本监控。使用 IAM 策略控制对日志的访问。设置定期报告以进行日志审计。
- D. 启用并配置 Amazon RDS 原生数据库审计日志记录。启用 Amazon CloudWatch 日志。配置指标过滤器和告警。配置 AWS CloudTrail 审计日志记录。
答案: D
解析: 选项D是正确答案,因为它结合了原生Amazon RDS数据库审计日志记录(捕获数据库内用户进行的数据级别更改)、AWS CloudTrail(捕获实例级别的API调用和更改)以及Amazon CloudWatch Logs(存储日志并支持指标筛选器和告警进行监控)。选项A仅使用CloudWatch Logs,无法原生跟踪用户级别的数据库修改。选项B使用EventBridge,该服务是为应用程序事件设计的,而非数据库活动流。选项C依赖CloudTrail记录API调用,但无法捕获数据库内部的数据修改。因此,选项D是最全面的解决方案,同时满足跟踪用户数据修改和数据库实例更改这两项要求。
第 7 题 · 题号 263 · 单选
一家公司正在使用 AWS Glue 构建数据处理管道。这些管道访问存储在 Amazon S3 中的数据。该公司已将数据组织到带有前缀的文件夹中,这些前缀代表不同的分类级别。该公司需要限制 AWS Glue 作业只能根据数据分类访问特定的前缀。此外,公司还必须将访问限制在工作时间(上午 9 点至下午 5 点)。该公司在自定义 IAM 策略中必须包含哪些元素才能满足这些要求?
- A. 一个资源元素,使用带有通配符的 S3 对象 Amazon 资源名称 (ARN) 模式(用于每个前缀),以及一个使用 $util.time 变量(带有 TimeGreaterThan 和 TimeLessThan 运算符)的条件元素。
- B. 一个资源元素,包含使用通配符匹配各前缀的 S3 对象 Amazon 资源名称 (ARN) 模式,以及一个使用 aws:CurrentTime 条件键并搭配 DateGreaterThan 和 DateLessThan 运算符的条件元素。
- C. 一个使用 s3:prefix 条件键来限制文件夹访问,并使用 aws:CurrentTime 与 DateGreaterThanEquals 和 DateLessThanEquals 来限制运营时间的条件元素。
- D. 使用 s3:ResourceAccount 条件键来限制存储桶访问的 Condition 元素,以及在工作时间之外生效的 Deny 语句。
答案: B
解析: 正确答案是B,因为要将AWS Glue作业限制到特定的S3前缀,需要在Resource元素中使用带有通配符的S3对象ARN模式(例如:arn:aws:s3:::bucket-name/prefix/*)。对于基于时间的访问限制,aws:CurrentTime是正确的IAM条件键,并且可以使用DateGreaterThan和DateLessThan运算符来定义营业时间(上午9点至下午5点)。选项A使用了不存在的$util.time变量,这在IAM中无效。选项C错误地建议使用s3:prefix作为条件键(前缀限制应该放在Resource元素中)。选项D使用s3:ResourceAccount来按账户限制访问,而不是按前缀限制,并且没有正确处理时间限制要求。
第 8 题 · 题号 264 · 单选
一家公司将历史客户数据存储在 Amazon Redshift 表中。一个名为 Email(电子邮件)的列包含空值以及不是电子邮件地址的条目。Email 列的数据质量对多个下游流程至关重要。数据工程师必须创建一个 AWS Glue Data Quality(数据质量)规则,当 Email 列中有效电子邮件地址的百分比低于 90% 时,该规则判定为失败。AWS Glue Data Quality 规则的哪个组件能够满足这些要求?
- A. 唯一性"Email"匹配"[%@%.%]",阈值设置为 > 0.9
- B. ColumnValues "Email" 匹配 "[%@%.%]",阈值设置为 > 0.1
- C. 列值 "Email" 匹配 "[%@%.%]",阈值设置为 > 0.9
- D. 唯一值比率"Email"匹配"[%@%.%]",阈值设置为 > 0.1
答案: C
解析: 正确的组件是ColumnValues,因为它允许检查列中的值是否匹配指定的正则表达式模式。模式 '[%@%.%]' 是一个基本的电子邮件格式模式,用于检查字符、'@' 和 '.' 的存在。阈值应设置为 > 0.9 以表示 90% 的要求 - 如果有效电子邮件地址的百分比降至 90% 以下,则该规则将失败。选项 A 使用 Uniqueness,它检查的是唯一值,而不是有效的电子邮件。选项 B 使用了正确的组件,但阈值不正确(应该是 0.9 而不是 0.1)。选项 D 使用 UniqueValueRatio,它检查的是唯一值的比率,而不是电子邮件的有效性。
第 9 题 · 题号 265 · 单选
一家公司将敏感的交易数据存储在 Amazon S3 存储桶中。数据工程师必须实施控制措施以防止意外删除。哪种解决方案可以满足此要求?
- A. 在S3存储桶上启用版本控制,并配置MFA删除。
- B. 配置一个 S3 存储桶策略规则,拒绝创建 S3 删除标记。
- C. 创建一个 S3 生命周期规则,将删除的文件移至 S3 Glacier Deep Archive。
- D. 设置 AWS Config 修复操作以防止用户删除 S3 对象。
答案: A
解析: 在 S3 存储桶上启用版本控制可以保留对象的多个版本,从而允许从意外删除中恢复。配置 MFA 删除通过要求多因素身份验证来永久删除对象版本,从而增加了额外的安全层,直接防止意外删除。这是 AWS 推荐的用于保护 S3 数据免受意外删除的最佳实践。
第 10 题 · 题号 266 · 单选
一家公司的应用程序需要以近实时的方式搜索和分析数据。该应用程序必须能够每秒处理多达 1,000 个请求,同时保持较低的查询延迟。公司希望采用一种可由各个数据团队独立负责和配置的解决方案,以满足各团队的成本和性能优化要求。哪种解决方案能够满足这些要求?
- A. 使用 Amazon S3 存储桶来存储数据。使用 Amazon Athena 来查询和分析数据。为每个数据团队分配一个单独的 S3 存储桶前缀以优化查询。
- B. 使用 Amazon Kinesis Data Streams 和 Amazon Managed Service for Apache Flink 来查询和分析数据。为每个数据团队分配一个单独的流以进行管理和消费。
- C. 使用带有索引功能的 Amazon OpenSearch Service 集群来查询数据。为每个数据团队分配一个单独的集群,以配置用于存储和查询。
- D. 使用运行在 Aurora I/O 优化实例上的 Amazon Aurora 集群。为每个数据团队分配一个单独的 Aurora 集群,用于配置存储和查询。
答案: C
解析: 正确答案是C。Amazon OpenSearch Service专为低查询延迟的搜索和分析工作负载而设计。它支持近实时索引和搜索,直接满足“近实时搜索和分析数据”以及“低查询延迟”的要求。此外,为每个数据团队分配单独的集群,允许他们独立配置和优化自己的成本和性能设置。选项A(Athena)用于S3上的批量查询,不是实时的。选项B(Kinesis/Flink)用于流处理,并非专门用于搜索。选项D(Aurora)是关系型数据库,未针对搜索工作负载进行优化。