MLA-C01 题库 · 最新 50 题免费预览(第 5/5 页)
MLA-C01(AWS Certified Machine Learning Engineer Associate (MLA))最新题库第 41–50 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 233 题。
第 41 题 · 题号 224 · 单选
一家医院正在使用机器学习模型来验证X光检查结果。该医院运行每晚的批量推理任务。该医院需要生成关于模型数据质量和模型性能的每日报告。哪种解决方案能满足这些要求?
- A. 在 Amazon SageMaker Model Monitor 中安排监控任务。生成模型和数据的监控结果。
- B. 创建一个 Amazon CloudWatch 仪表板,其中包含夜间批量推理作业中处理步骤的指标。比较基线资源指标。共享仪表板链接。
- C. 使用 AWS Glue DataBrew 创建一个自定义配方作业,对模型文件使用数值统计(Numerical Statistics)数据质量检查,并生成结果。
- D. 创建一个包含 QualityCheck 步骤的 SageMaker AI 管道,以运行监控作业。生成模型和数据的监控结果。
答案: D
第 42 题 · 题号 225 · 单选
一家公司在新创建的VPC的公有子网中运行Amazon SageMaker AI域。网络配置正确,ML工程师可以访问SageMaker AI域。最近,该公司发现有来自特定IP地址的可疑流量访问该域。公司需要阻止来自该特定IP地址的流量。哪项网络配置的更新能满足此要求?
- A. 创建一个安全组入站规则,以拒绝来自特定IP地址的流量。将安全组分配给域。
- B. 创建一个网络 ACL 入站规则,以拒绝来自特定 IP 地址的流量。将该规则分配给域名所在子网的默认网络 ACL。
- C. 为该域创建一个影子变体。配置 SageMaker Inference Recommider 将来自特定 IP 地址的流量发送至影子端点。
- D. 创建一个 VPC 路由表,以拒绝来自特定 IP 地址的入站流量,并将该路由表分配给该域。
答案: B
解析: 网络ACL(NACL)是无状态的,并且同时支持允许和拒绝规则,这使得它们适合在子网级别阻止来自特定IP地址的流量。安全组(选项A)只支持允许规则,无法明确拒绝来自特定IP的流量。VPC路由表(选项D)无法拒绝来自特定IP地址的流量,因为它们用于引导流量目的地,而不是过滤源IP。影子变体(选项C)用于A/B测试和模型部署,而不是用于阻止流量。因此,创建网络ACL入站拒绝规则是正确的方法。
第 43 题 · 题号 226 · 单选
一家公司正在使用 Amazon SageMaker AI 开发信用风险评估模型。在模型验证过程中,该公司发现该模型在验证数据上达到了 82% 的准确率。然而,该模型在训练数据上达到了 99% 的准确率。该公司需要在部署前解决模型准确性问题。哪种解决方案能满足此需求?
- A. 添加更多的全连接层以增加模型复杂度。实现批量归一化。在训练过程中使用早停。
- B. 实现 dropout 层(随机失活层)。使用 L1 或 L2 正则化。执行 k 折交叉验证。
- C. 使用主成分分析(PCA)来降低特征维度。减少模型层数。实现交叉熵损失函数。
- D. 增加训练数据集。
从训练数据集中移除重复记录。
实施分层采样。
答案: B
解析: 模型在训练数据上达到99%的准确率,但在验证数据上仅达到82%,这是典型的过拟合现象。选项B通过三种互补技术直接解决过拟合问题:Dropout层在训练过程中随机停用神经元,防止模型过度依赖特定特征;L1/L2正则化向损失函数添加惩罚项以约束模型权重并降低复杂度;K折交叉验证提供稳健的评估,确保模型具有良好的泛化能力。选项A、C和D要么会加剧过拟合(增加复杂度),要么包含相关性较低的技术。选项B是最全面和最合适的解决方案。
第 44 题 · 题号 227 · 单选
一个机器学习工程师希望使用、准备并加载来自 Amazon S3 的数据用于分析。该机器学习工程师必须运行一个提取、转换和加载 (ETL) 作业来发现数据的架构并存储元数据。哪种解决方案能够以最少的人工工作量满足这些要求?
- A. 使用 AWS Glue 运行 ETL 作业。使用该作业来发现架构,并将相关的元数据存储在 AWS Glue Data Catalog 中。
- B. 创建一个 Amazon SageMaker Data Wrangler 流以运行 ETL 作业。使用该作业来发现模式并将相关的元数据存储在 S3 存储桶中。
- C. 使用与 AWS Step Functions 集成的 Amazon Athena 创建一个 ETL 管道。使用该管道运行 ETL 作业以发现架构,并将相关元数据存储在 S3 存储桶中。
- D. 启动一个包含 scikit-learn 库的 Amazon EC2 实例来运行 ETL 作业。使用该作业来发现模式并将相关元数据存储在 Amazon Redshift 中。
答案: A
解析: AWS Glue 是一个完全托管的 ETL(提取、转换和加载)服务,旨在自动发现 Amazon S3 中数据的架构,并将相关元数据存储在 AWS Glue 数据目录中。与其他选项相比,这种无服务器方法需要最少的手动工作,而其他选项要么涉及更多手动配置(SageMaker Data Wrangler)、协调多个服务(与 Step Functions 集成的 Athena),要么自行管理基础设施(带有 scikit-learn 的 EC2)。因此,选项 A 是满足给定要求的最有效解决方案。
第 45 题 · 题号 228 · 单选
一家物流公司已安装车载摄像头,用于对驾驶员进行基本监测。该公司希望通过识别可能导致事故的驾驶员分心行为来提升行车安全。哪项解决方案能以最少的运营工作量满足此需求?
- A. 使用 Amazon Rekognition 视线方向检测来监控驾驶员行为并识别分心行为。
- B. 使用 Amazon SageMaker AI 自定义 AI 模型,以监控驾驶员行为并识别分心行为。
- C. 将第三方驾驶员监控系统与 Amazon Rekognition 集成,以监控驾驶员行为并识别分心情况
- D. 使用 Amazon Comprehend 分析基于文本的驾驶员反馈并识别分心行为。
答案: A
解析: Amazon Rekognition 是一个完全托管的 AI 服务,提供开箱即用的功能,包括视线方向检测。这个现成的功能只需最少的运维工作量,因为它无需构建、训练和部署自定义模型(不像 Amazon SageMaker)。它还避免了集成第三方系统的复杂性(不像选项 C),并且适合分析车载摄像头的视频流(不像 Amazon Comprehend,后者是专为文本分析设计的)。因此,选项 A 提供了最简单、运维开销最小的解决方案。
第 46 题 · 题号 229 · 单选
一位机器学习工程师正在分析一个分类数据集,以便在 Amazon SageMaker AI 中训练模型。该机器学习工程师怀疑数据集中类标签之间存在显著的不平衡,这可能导致模型预测产生偏差。为了确认类不平衡问题,该机器学习工程师需要选择一个合适的训练前偏差指标。哪个指标能满足这一要求?
- A. 均方误差(MSE)
- B. 标签比例差异(DPL)
- C. 轮廓系数
- D. 结构相似性指数 (SSIM)
答案: B
解析: 标签比例差异(DPL)是 Amazon SageMaker Clarify 中的一种训练前偏差指标,专门用于检测数据集中类标签之间的不平衡。MSE 用于回归问题,轮廓系数用于聚类评估,SSIM 用于图像相似度比较。由于 ML 工程师正在分析分类数据集中的类不平衡,并且需要一个训练前偏差指标,因此 DPL 是正确的选择。
第 47 题 · 题号 230 · 单选
一家公司有一个部署在 Amazon SageMaker 终端节点上用于实时推理的机器学习模型。该公司需要部署一个新模型。在将所有流量切换到新模型之前,公司必须将新模型的性能与当前部署模型的性能进行比较。哪种解决方案能够以最少的运维工作量满足这些要求?
- A. 将新模型部署到一个单独的端点。在两个端点之间手动分配流量。
- B. 将新模型部署到一个独立的终端节点。使用 Amazon CloudFront 在两个终端节点之间分配流量。
- C. 将新模型作为影子变体部署在与当前模型相同的端点上。将一部分实时流量路由到影子模型进行评估。
- D. 使用带有自定义逻辑的 AWS Lambda 函数在当前模型和新模型之间路由流量。
答案: C
解析: Amazon SageMaker 内置支持影子变体(shadow variants)功能,允许你将新模型与当前生产模型一同部署在同一个端点上。影子变体会接收一部分实时流量(或推理请求的副本)用于评估,但不会影响返回给客户端的响应。这是一个托管功能,与部署单独的端点、手动拆分流量、设置 CloudFront 路由或编写自定义 Lambda 逻辑相比,需要的操作工作量最少。选项 A 需要手动管理流量,选项 B 误用了 CloudFront(它是为内容分发设计的,而非 ML 推理路由),选项 D 则需要编写和维护自定义路由逻辑。
第 48 题 · 题号 231 · 单选
某公司正在使用 Amazon SageMaker AI 创建一个分类模型,以 1 到 5 的等级对公司过去 20 年中每个月的销售业绩进行分类。该数据集包含月份、销售区域、区域总销售额以及每个销售区域的门店数量等字段。公司注意到,每年中有两个月份的总销售额数值异常偏高。公司对训练和验证数据集中的所有非数值特征进行了独热编码(one-hot encoding)。公司使用训练数据集训练分类模型。当公司使用验证数据集评估模型时,结果的准确性低于预期。公司必须提高模型在验证数据集上的准确性。哪种解决方案能够满足此要求?
- A. 删除包含所有特征异常值的记录。
- B. 在月份和销售区域特征上使用分层划分。
- C. 对聚合销售特征进行归一化处理。
- D. 对每个销售区域的聚合销售特征进行归一化处理。
答案: D
第 49 题 · 题号 232 · 单选
一位机器学习工程师正在 Amazon SageMaker AI 中构建机器学习模型。该机器学习工程师需要将历史数据直接从 Amazon S3、Amazon Athena 和 Snowflake 加载到 SageMaker AI 中。哪种解决方案能够满足此需求?
- A. 使用 AWS Glue DataBrew 将数据导入到 SageMaker AI。
- B. 在 SageMaker Pipelines 中构建管道以处理数据。使用 AWS DataSync 将处理后的数据加载到 SageMaker AI 中。
- C. 在 SageMaker Feature Store 中创建一个特征存储。使用 Apache Spark 连接器访问 Feature Store 中的数据。
- D. 使用 SageMaker Data Wrangler 查询和导入数据。
答案: D
解析: SageMaker Data Wrangler 是正确的解决方案,因为它原生支持从 Amazon S3、Amazon Athena 和 Snowflake 直接导入数据。它提供了一个可视化界面,允许 ML 工程师查询、转换数据并将其直接导入到 SageMaker AI 中以进行模型构建。选项 A(Glue DataBrew)主要用于数据准备,而不是直接加载到 SageMaker AI。选项 B(使用 DataSync 的 SageMaker Pipelines)不合适,因为 DataSync 旨在在存储服务之间传输数据,而不是用于从 Athena 和 Snowflake 等查询源将数据加载到 SageMaker AI。选项 C(带有 Spark 连接器的 Feature Store)专为特征管理和检索而设计,而不是用于从多个源进行初始数据导入。
第 50 题 · 题号 234 · 单选
一个机器学习模型已部署到生产环境中。该模型表现良好,几个月来一直达到其指标阈值。一位负责监控该模型的机器学习工程师观察到性能突然下降。模型的性能指标现在已低于阈值。导致性能下降的原因可能是什么?
- A. 缺乏训练数据
- B. 生产环境数据分布漂移
- C. 计算资源限制
- D. 模型过拟合
答案: B
解析: 已部署的生产环境中机器学习模型表现良好,但突然出现性能下降,最可能的原因是生产数据分布发生漂移。当输入的生产数据的统计特性相对于模型训练时的数据发生变化时(概念漂移或数据漂移),模型的预测准确性会降低,导致性能指标低于既定阈值。选项A(训练数据不足)不正确,因为训练数据的可用性不会影响已部署的模型。选项C(计算资源限制)会导致延迟或可用性问题,但不会导致预测准确性的下降。选项D(过拟合)是一个训练阶段的问题,应该在部署之前就被发现,而不会在模型运行良好数月后突然出现。