MLA-C01 题库 · 最新 50 题免费预览(第 2/5 页)
MLA-C01(AWS Certified Machine Learning Engineer Associate (MLA))最新题库第 11–20 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 233 题。
第 11 题 · 题号 194 · 单选
一家公司正在准备数据以在 Amazon SageMaker AI 上训练新的机器学习模型。该数据之前未用于机器学习训练。数据包含重复项且缺少部分值。该公司需要提高数据质量并检测数据中的任何统计偏差。哪种解决方案能满足这些要求?
- A. 使用 SageMaker Clarify 创建数据质量规则。使用 SageMaker Model Monitor 检测偏差。
- B. 使用 SageMaker Data Wrangler 创建数据质量规则。使用 SageMaker Clarify 检测偏差。
- C. 使用 SageMaker Debugger 创建数据质量规则。使用 SageMaker Model Monitor 检测偏差。
- D. 使用 SageMaker Model Monitor 创建数据质量规则。使用 SageMaker Clarify 检测偏差。
答案: B
解析: SageMaker Data Wrangler 专门用于数据准备任务,可以创建数据质量规则来处理重复值和缺失值等问题。SageMaker Clarify 是检测数据集中统计偏差的合适工具,在训练之前就可以使用。SageMaker Model Monitor 用于监控生产环境中已部署的模型,而 SageMaker Debugger 用于调试训练作业,因此选项 A、C 和 D 都是不正确的。
第 12 题 · 题号 195 · 单选
一位机器学习工程师使用A/B测试动态选择推荐模型。这些模型部署在Amazon SageMaker AI端点上。该工程师需要在端点被调用时监控系统指标,如延迟、调用量和HTTP状态码。哪种解决方案能满足这些要求且运维开销最小?
- A. 使用 AWS X-Ray 跟踪来监控 SageMaker AI 端点。
- B. 配置 Amazon CloudWatch 仪表板与 AWS Lambda 日志处理器。
- C. 启用 AWS Identity and Access Management (IAM) Access Analyzer 来跟踪 SageMaker AI 端点指标。
- D. 在 SageMaker AI 端点实例上部署 AWS Trusted Advisor 检查。
答案: B
解析: Amazon CloudWatch 是 AWS 原生的监控服务,可以与 SageMaker AI 端点无缝集成。它会自动收集延迟、调用次数(呼叫量)等指标,并通过 CloudWatch Logs 和指标监控 HTTP 状态码。尽管选项 B 提到了 Lambda 日志处理器,但在所有选项中,CloudWatch 仍然是运维效率最高的方案。选项 A(X-Ray)主要用于单个请求的分布式追踪,而非聚合的系统指标。选项 C(IAM Access Analyzer)用于分析 IAM 权限,而非监控指标。选项 D(Trusted Advisor)提供最佳实践建议和成本优化,并非实时端点指标。因此,B 是以最少运维开销满足指定监控需求的最佳答案。
第 13 题 · 题号 196 · 单选
一家公司正在使用 Amazon SageMaker AI 构建机器学习模型来预测客户行为。该公司需要向审计员解释模型中的偏差。解释必须聚焦于客户的 demographics(人口统计)数据。哪种解决方案能满足这些要求?
- A. 使用 SageMaker Clarify 生成偏差报告,并将报告发送给审计员。
- B. 使用 AWS Glue DataBrew 创建任务,以检测模型数据质量的漂移。将任务输出发送给审计员。
- C. 使用 Amazon Quick Suite(之前称为 Amazon QuickSight)与 SageMaker AI 的集成,从 Quick Suite 生成偏差报告。将报告发送给审计员。
- D. 使用 SageMaker AI 命名空间中的 Amazon CloudWatch 指标创建偏差仪表板,并将该仪表板共享给审计员。
答案: A
解析: Amazon SageMaker Clarify 是专门用于检测机器学习模型偏差的工具,特别专注于年龄、性别和种族等人口统计数据。它提供偏差指标并生成详细的偏差报告,可以与审计员共享。其他选项不太合适:Glue DataBrew 专注于数据质量和漂移检测,但不能检测关于人口统计数据的机器学习模型偏差;QuickSight 是商业智能可视化工具,并非为机器学习偏差检测而设计;CloudWatch 用于监控基础设施指标,不能用于分析机器学习模型的偏差。
第 14 题 · 题号 197 · 单选
一个机器学习工程团队分布在多个地点。当首席机器学习工程师打开 Amazon SageMaker AI 笔记本时,该机器学习工程师看不到其他团队成员从 Git 仓库合并的最新笔记本内容。首席机器学习工程师必须看到最新的 SageMaker AI 笔记本更新。哪种解决方案能满足此要求?
- A. 运行 !git pull origin master 命令。
- B. 运行 !git commit 命令。
- C. 运行 !git push origin master 命令。
- D. 运行 !git branch 命令。
答案: A
解析: !git pull origin master 命令从远程 master 分支获取最新的更改并将其合并到本地仓库。这将使用其他团队成员所做的最新合并的笔记本更新来更新 SageMaker AI 笔记本环境。其他选项不正确:git commit 仅保存本地更改,git push 将本地更改发送到远程(方向相反),而 git branch 仅列出可用的分支,而不会更新本地仓库。
第 15 题 · 题号 198 · 单选
一个推荐模型使用机器学习并调用 Amazon SageMaker AI 端点来获取推荐结果。一名机器学习工程师必须确保该模型在用户流量预期增加期间保持可用。哪种解决方案能满足这些要求?
- A. 在 SageMaker AI 端点上配置自动扩展。
- B. 创建一个新的 SageMaker AI 端点。将模型部署到新端点。
- C. 使用 SageMaker Neo 优化模型以进行推理。
- D. 将自动扩缩组附加到 SageMaker AI 端点。
答案: A
解析: 正确的解决方案是在 SageMaker AI 终端节点上配置自动扩展。Amazon SageMaker 提供了内置的自动扩展功能,可以根据流量模式和定义的策略(例如目标跟踪或步进扩展)自动调整为终端节点提供服务的实例数量。这可以确保模型在用户流量预期增加期间保持可用性。选项 B(创建新终端节点)无法解决扩展问题,也不会改善情况。选项 C(SageMaker Neo)可优化模型的推理性能,但无法处理流量激增或可用性问题。选项 D 是不正确的,因为 Auto Scaling 组是 EC2 功能,不能直接附加到 SageMaker 终端节点——SageMaker 拥有自己的原生自动扩展功能。
第 16 题 · 题号 199 · 单选
一家公司希望使用由Amazon Bedrock支持的大语言模型(LLM)来开发一个用于公司内部技术文档的聊天界面。该公司将这些文档存储为数十个文本文件,总大小为几兆字节。该公司经常更新这些文本文件。哪种解决方案能以最低成本满足这些要求?
- A. 在Amazon Bedrock上创建一个新的LLM。使用原始数据集和公司文档训练该新模型,并将其在Bedrock中上线,供聊天界面调用。
- B. 将公司文档与 Amazon Bedrock 护栏集成。从聊天界面为所有 Amazon Bedrock 调用启用护栏。
- C. 使用所有文本文件在 Amazon Bedrock 中对模型进行微调。使用微调后的模型来处理用户提示。
- D. 将所有文本文件上传到 Amazon Bedrock 知识库。当聊天界面调用 Amazon Bedrock 时,使用该知识库来提供上下文。
答案: D
解析: Amazon Bedrock 知识库使用检索增强生成(RAG)来索引文档,并为每个提示检索相关上下文。公司无需重新训练或微调模型即可更新或替换文档,因此这是最具成本效益的解决方案。Guardrails 用于管理模型行为,不能提供文档检索功能;而创建或微调模型没有必要,并且对于频繁更新的内容而言成本更高。
第 17 题 · 题号 200 · 单选
一家保险公司的机器学习工程师训练了一个回归模型,用于预测每月的保险保单销售数量。训练完模型后,该机器学习工程师使用 Amazon SageMaker AI 部署模型以进行推理。该机器学习工程师希望监控模型预测,以便在客户行为发生变化时检测生产数据分布是否与训练数据分布不同。哪种解决方案能够满足这些要求?
- A. 判断数据质量是否存在漂移。
- B. 确定模型质量是否存在漂移。
- C. 判断模型偏差是否存在漂移。
- D. 判断特征归因是否存在漂移。
答案: A
解析: 该需求是检测生产数据分布是否因客户行为变化而与训练数据分布不同。这是典型的数据漂移检测场景。Amazon SageMaker 的数据质量监控(Model Monitor)会追踪输入特征的统计属性,并比较训练数据集和生产数据集之间的差异,从而检测客户行为变化导致的分布偏移。模型质量(B)需要真实标签(ground truth)来监控预测性能指标,而非数据分布;模型偏差(C)追踪敏感属性之间的公平性指标;特征归因(D)通过 SHAP 值监控特征重要性的变化,而非输入分布本身。
第 18 题 · 题号 201 · 单选
一家公司正在对提供产品推荐的模型进行A/B测试。该公司部署了两个版本的模型,并将每个版本随机展示给50%的用户。公司应该使用哪个指标来评估用户是否会根据推荐采取行动?
- A. 两个版本模型之间的转换率
- B. 提供给每个用户的推荐数量
- C. 模型在留出测试数据上的准确率
- D. 模型推理的延迟
答案: A
解析: 转化率直接衡量用户是否对推荐采取了行动(例如点击、购买或与推荐产品互动)。在推荐模型的 A/B 测试中,转化率是衡量用户对推荐行为响应的关键业务指标。其他选项衡量的要么是不相关的方面(推荐数量、延迟),要么是部署前的指标(保留测试数据上的模型准确率),这些都不能反映现实世界中的用户行为。
第 19 题 · 题号 202 · 多选
一家公司正在开发一款应用程序,该程序从用户提示中读取动物描述,并根据提示中的信息生成图像。该程序从 Amazon Simple Queue Service(Amazon SQS)队列中读取一条消息。然后,该程序使用 Amazon Bedrock 上的 Amazon Titan 图像生成器,根据消息中的信息生成一张图像。最后,该程序从 SQS 队列中移除该消息。该公司应为其应用程序的 IAM 角色分配哪些 IAM 权限?(请选择两项)
- A. 允许对 Amazon Titan 图像生成器资源执行 bedrock:InvokeModel 操作。
- B. 允许对 Amazon Titan 图像生成器资源执行 bedrock:Get* 操作。
- C. 允许对 SQS 队列资源执行 sqs:ReceiveMessage 操作和 sqs:DeleteMessage 操作。
- D. 允许对 SQS 队列资源执行 sqs:GetQueueAttributes 操作和 sqs:DeleteMessage 操作。
- E. 允许对 Amazon Titan 图像生成器资源执行 sagemaker:PutRecord* 操作。
答案: A, C
解析: 选项A是正确的,因为要调用Amazon Bedrock上的Amazon Titan图像生成器,应用程序需要bedrock:InvokeModel权限。选项C是正确的,因为应用程序需要sqs:ReceiveMessage来从SQS队列中读取消息,并需要sqs:DeleteMessage在处理后从队列中删除消息。选项B不正确,因为Get*操作用于检索信息,而不是调用模型。选项D不正确,因为GetQueueAttributes不用于读取消息;需要ReceiveMessage。选项E不正确,因为Amazon Titan图像生成器在Amazon Bedrock上,而不是SageMaker上,并且PutRecord用于Kinesis流。
第 20 题 · 题号 203 · 单选
一家公司正在创建一个用于识别产品缺陷的机器学习模型。该公司已收集了一个数据集,并将该数据集以TIFF格式存储在Amazon S3中。该数据集包含200张图像,其中显示了最常见的缺陷。该数据集还包含1,800张图像,其中没有显示任何缺陷。一位机器学习工程师训练模型后,注意到某些类别的性能较差。该机器学习工程师发现数据集中存在类别不平衡问题。该机器学习工程师应该怎么做来解决这个问题?
- A. 使用几百张图像和 Amazon Rekognition Custom Labels 来训练新模型。
- B. 对其中可见最常见缺陷的200张图像进行欠采样。
- C. 对包含最常见缺陷的200张图像进行过采样。
- D. 使用全部2,000张图片和Amazon Rekognition Custom Labels来训练新模型。
答案: C
解析: 该数据集存在明显的类别不平衡问题,只有200张包含缺陷的图像,而没有缺陷的图像却有1800张(比例为1:9)。为了解决这个问题,ML工程师应该通过对少数类(200张缺陷图像)进行过采样来增加这些图像的数量,或者通过数据增强创建这些图像的副本。这样做有助于平衡数据集,并提高模型学习缺陷类别特征的能力。选项B会加剧不平衡问题,选项A和D都没有解决类别不平衡的问题。