MLA-C01 题库 · 最新 50 题免费预览(第 4/5 页)
MLA-C01(AWS Certified Machine Learning Engineer Associate (MLA))最新题库第 31–40 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 233 题。
第 31 题 · 题号 214 · 单选
一家公司希望推出一个新的网站功能,该功能可根据用户提供的房屋属性来预测房价。这些属性包括位置、面积以及卧室和浴室的数量。一位机器学习工程师使用 Amazon SageMaker AI XGBoost 算法训练了一个回归模型。该模型在训练数据上表现良好。然而,在使用真实世界数据进行验证时,该模型的性能显著欠佳。哪种解决方案能以最少的实施工作量提高该模型的验证得分?
- A. 创建一个包含更多真实世界数据的更大训练数据集。重新训练模型。
- B. 增加 num_round 超参数的值。
- C. 将评估指标超参数从均方根误差 (RMSE) 更改为误差。
- D. 增大 lambda 超参数的取值。
答案: A
第 32 题 · 题号 215 · 多选
一位机器学习工程师正在设计一个由人工智能驱动的交通管理系统,用于在预测到拥堵时调整交通信号灯。该系统必须使用近实时推理来生成预测,以帮助防止交通碰撞。该系统必须使用批处理流水线来对预测进行历史分析,以不断完善和改进模型。历史分析将花费数小时来评估预测与实际结果的相关程度。该系统必须能够适当地扩展推理端点以满足需求。哪种解决方案组合可以满足这些要求?(选择两项。)
- A. 使用 Amazon SageMaker 实时推理端点。配置这些端点,使其根据使用 ConcurrentInvocationsPerInstance 指标的 target tracking(目标追踪)扩展策略自动进行扩缩容。
- B. 为 AWS Lambda 函数配置预留并发以处理流式数据。使用 Lambda SnapStart 将 Lambda 函数连接到 Amazon SageMaker 实时终端节点,以支持近实时流量预测。
- C. 配置一个 Amazon SageMaker Processing 作业,用于对历史预测数据进行批量分析。使用 Amazon EventBridge 将该作业调度为每日运行。预留数小时的时间进行深入分析,以优化和改进交通管理模型。
- D. 使用 Amazon EC2 Auto Scaling 组来托管容器,以支持对历史预测数据的批量分析。配置基于 Amazon CloudWatch 指标的扩展,以分析多个小时内的历史流量模式和模型性能。
- E. 使用 AWS Lambda 函数执行历史分析。使用 Amazon EventBridge 来调用该 Lambda 函数。
答案: A, C
解析: 选项A正确,因为Amazon SageMaker实时推理端点专为近实时推理而设计,使用基于ConcurrentInvocationsPerInstance指标的目标跟踪扩展策略可以根据流量需求自动扩展,满足推理和可扩展性要求。选项C正确,因为Amazon SageMaker Processing作业专为批处理工作负载而构建,可以长时间运行(不像AWS Lambda有15分钟的超时限制),非常适合需要数小时的历史分析。使用Amazon EventBridge每日调度作业可自动化批处理管道。选项B不正确,因为AWS Lambda不适合需要低延迟的近实时推理,且预留并发是限制而非启用扩展。选项D不正确,因为EC2 Auto Scaling组不是机器学习批处理的AWS原生解决方案——SageMaker Processing更为合适。选项E不正确,因为AWS Lambda函数的最大执行时间为15分钟,无法满足需要数小时的历史分析。
第 33 题 · 题号 216 · 单选
一家公司正在开发一个机器学习模型,用于根据时间序列数据预测未来值。数据集包括以固定间隔收集的历史测量数据和分类特征。该模型需要根据过去的模式和趋势来预测未来值。该公司应使用哪种算法和超参数来开发该模型?
- A. 使用 Amazon SageMaker AI XGBoost 算法。设置 scale_pos_weight 超参数以调整类别不平衡问题。
- B. 使用 k-means 聚类算法,其中 k 用于指定聚类的数量。
- C. 使用 Amazon SageMaker AI DeepAR 算法,并配置匹配的 context_length 和 prediction_length 超参数。
- D. 使用 Amazon SageMaker AI 随机切割森林(RCF)算法,并通过设置污染率(contamination)来设定预期的异常比例。
答案: C
解析: 选项C是正确的答案,因为Amazon SageMaker AI DeepAR算法是专为时间序列预测设计的。它使用循环神经网络(RNN)根据过去的模式和趋势预测未来值。context_length超参数定义了模型应考虑多少个过去的时间步长,而prediction_length定义了要预测多少个未来步长。匹配这些超参数是DeepAR的最佳实践。其他选项不正确:A)带有scale_pos_weight的XGBoost用于具有类别不平衡的分类问题,而非时间序列预测;B)k-means用于聚类,而非预测;D)Random Cut Forest用于异常检测,而非预测未来值。
第 34 题 · 题号 217 · 单选
一家公司开发了一个推荐模型,并将该模型部署在 Amazon SageMaker AI 终端节点上。该模型使用 SageMaker AI 终端节点执行近乎实时的推理,根据浏览历史、购买记录和应用内用户交互向客户提供个性化的产品推荐。在一次大型营销活动之后,该公司观察到模型性能急剧下降。该公司需要一种解决方案,以便在未来的营销活动之前主动监控、检测和验证模型性能。哪种解决方案能够满足这些要求?
- A. 使用 SageMaker Clarify 分析特征分布的变化。为 SageMaker Model Monitor 配置近实时输入验证。
- B. 使用 Amazon CloudWatch 仪表板监控端点指标。使用 SageMaker Model Monitor 跟踪特征归因。
- C. 使用 SageMaker Clarify 进行偏见检测。设置 Amazon CloudWatch 警报来监控模型延迟。
- D. 使用 SageMaker Model Monitor 监控约束。使用 Amazon CloudWatch Logs Insights 分析错误模式。
答案: A
解析: 选项A是正确答案,因为它直接满足了主动监控、检测和验证模型性能的要求。SageMaker Clarify可以分析特征分布的变化(数据漂移检测),这对于识别由于营销活动导致的输入模式变化至关重要。SageMaker Model Monitor结合近实时输入验证可以持续监控推理数据,并在输入异常或漂移显著影响性能之前检测到它们。选项B侧重于特征归因(可解释性),而不是主动验证。选项C处理偏差检测和延迟问题,无法解决性能下降的问题。选项D使用Logs Insights分析错误模式,这更偏向于被动响应。只有选项A提供了特征分布分析和近实时输入验证相结合的方案,能够满足这些要求。
第 35 题 · 题号 218 · 单选
一家公司正在使用 Amazon SageMaker AI 中的 PyTorch 和 TensorFlow 估计器来开发机器学习模型。一位机器学习工程师已配置好 SageMaker AI 估计器,现在需要启动一个使用训练数据集的训练任务。哪个 SageMaker AI SDK 方法可以启动该训练任务?
- A. 拟合方法
- B. 创建模型方法
- C. 部署方法
- D. 预测方法
答案: A
解析: fit 方法是用于启动训练作业的标准 SageMaker AI SDK 方法。在 SageMaker 中使用 PyTorch 和 TensorFlow 估算器时,调用 estimator.fit() 将使用指定的训练数据集启动训练过程。其他方法用途不同:create_model 创建 SageMaker 模型构件,deploy 创建用于推理的终端节点,predict 针对已部署的终端节点执行推理。
第 36 题 · 题号 219 · 单选
一家公司需要执行特征工程、聚合和数据准备工作。在生成特征后,该公司必须在AWS上实施一个解决方案来处理和存储这些特征。哪种解决方案能满足这些要求?
- A. 使用 Amazon SageMaker 特征处理来处理和提取数据。使用 SageMaker 特征存储来管理和存储特征。
- B. 使用 Amazon SageMaker Model Monitor 自动摄取和转换数据。创建一个 Amazon S3 桶以 JSON 格式存储特征。
- C. 使用 Amazon Managed Service for Apache Flink 转换数据,并将数据直接摄取到 Amazon SageMaker Feature Store 中。使用 Feature Store 来管理和存储特征。
- D. 使用 Amazon SageMaker 批量转换任务来分析、转换和摄取数据。创建一个 Amazon DynamoDB 表来存储特征。
答案: A
解析: Amazon SageMaker Processing 是用于特征工程、数据预处理和聚合任务的合适服务。结合专为管理、存储和共享机器学习特征而构建的 Amazon SageMaker Feature Store,此解决方案满足了所有要求。选项 B 错误,因为 SageMaker Model Monitor 用于监控已部署的模型,而不是用于特征工程。选项 C 不理想,因为 Amazon Managed Service for Apache Flink 主要用于实时流处理,而不是用于批量特征工程。选项 D 错误,因为 SageMaker 批量转换作业用于生成预测,而不是用于特征工程,且 DynamoDB 不是作为特征存储库设计的。
第 37 题 · 题号 220 · 单选
一位机器学习工程师希望使用 Amazon SageMaker AI 来准备训练数据。在探索性数据分析期间,该机器学习工程师注意到几个类别特征存在缺失值。该机器学习工程师如何使用 SageMaker AI 来解决这个问题?
- A. 使用 SageMaker Clarify 通过均值来插补分类特征。
- B. 使用 SageMaker Clarity 以众数对分类特征进行插补。
- C. 使用 SageMaker Data Wrangler 用均值填充分类特征。
- D. 使用 SageMaker Data Wrangler 通过众数来填充分类特征。
答案: D
解析: 对于具有缺失值的分类特征,适当的填充方法是众数(最常出现的值),而不是用于数值数据的平均值。SageMaker Data Wrangler 是用于数据准备任务的正确工具,包括填充缺失值,而 SageMaker Clarify 旨在用于偏差检测和模型可解释性,而不是数据准备。
第 38 题 · 题号 221 · 单选
一位机器学习工程师正在为一个机器学习模型设置 Amazon SageMaker AI 流水线。如果检测到任何数据漂移,该流水线必须自动启动重新训练作业。机器学习工程师应如何设置该流水线以满足此要求?
- A. 使用 AWS Glue 爬虫程序和 AWS Glue 提取、转换和加载 (ETL) 作业来检测数据漂移。使用 AWS Glue 触发器来自动化重新训练作业。
- B. 使用 Amazon Managed Service for Apache Flink 来检测数据漂移。使用 AWS Lambda 函数来自动化重新训练任务。
- C. 使用 SageMaker Model Monitor 来检测数据漂移。使用 AWS Lambda 函数来自动化重新训练任务。
- D. 使用 Amazon QuickSight 异常检测来检测数据漂移。使用 AWS Step Functions 工作流来自动化重新训练作业。
答案: C
解析: SageMaker Model Monitor 是 AWS 专门用于检测已部署 ML 模型中的数据漂移、模型质量漂移、偏差漂移和特征归因漂移的服务。它可以持续监控模型并捕获数据统计信息。当检测到数据漂移时,它可以触发警报并调用 AWS Lambda 函数来自动化下游工作流程,例如重新训练任务。选项 A(AWS Glue)、B(Managed Apache Flink)和 D(QuickSight)并非专为 ML 数据漂移检测而设计——Glue 用于 ETL,Flink 用于流处理,QuickSight 是商业智能可视化工具。
第 39 题 · 题号 222 · 单选
一家公司正在开发一个新的机器学习模型,用于根据客户偿还贷款的潜力对其进行排名。该公司需要使用 Amazon SageMaker AI 的内置算法。应该使用哪种算法来满足这些要求?
- A. 极端梯度提升(XGBoost)
- B. K均值聚类
- C. 主成分分析 (PCA)
- D. 神经主题模型 (NTM)
答案: A
解析: XGBoost 是一种监督式的梯度提升算法,在表格数据的排序、分类和回归任务中表现出色。由于它能够有效处理特征重要性、缺失值以及非线性关系,因此被广泛用于信用评分和贷款违约预测。Amazon SageMaker 将 XGBoost 作为内置算法提供,特别适合此类排序问题。K-means 是无监督聚类算法,PCA 用于降维,NTM 用于文本主题建模——这些都不符合按还款潜力对客户进行排序的需求。
第 40 题 · 题号 223 · 单选
一位机器学习工程师需要构建一个处理管道,用于从PB级别的非结构化数据中识别并删除个人身份信息(PII)。该机器学习工程师将使用处理后的数据在Amazon SageMaker AI中训练机器学习模型。哪种解决方案能满足这些要求?
- A. 使用 AWS Glue 交互式会话中基于 Apache Spark 的无服务器引擎。使用 Detect PII 转换功能来识别和删除 PII 数据。
- B. 在 Amazon SageMaker Canvas 中使用 AWS Glue Data Wrangler 来检测和删除个人身份信息 (PII)。
- C. 使用 Amazon SageMaker Clarify API 来检测和屏蔽个人身份信息 (PII) 数据。
- D. 使用 Amazon Comprehend 中的 DetectEntities API 操作来识别并删除个人身份信息(PII)数据。
答案: A
解析: 选项A是正确的,因为AWS Glue交互式会话提供基于无服务器Apache Spark的引擎,可以扩展处理PB级别的数据。AWS Glue中的Detect PII转换功能专门用于在Spark处理管道中识别和屏蔽/删除PII数据,这完全符合构建大规模数据处理管道的要求。处理后的数据可以轻松用于在Amazon SageMaker中训练ML模型。选项B不理想,因为Glue Data Wrangler更适合小规模数据准备,无法应对PB级数据。选项C不正确,因为SageMaker Clarify用于偏差检测和模型可解释性,而不是PII删除。选项D不正确,因为它提到的是DetectEntities API(用于命名实体识别,如人名、地名、组织),而不是DetectPIIEntities API,并且通过Comprehend API调用直接处理PB级数据不像基于Spark的解决方案那样具有可扩展性。