PracticeCF

MLA-C01 题库 · 最新 50 题免费预览(第 1/5 页)

MLA-C01(AWS Certified Machine Learning Engineer Associate (MLA))最新题库第 1–10 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 233 题。

第 1 题 · 题号 184 · 单选

一家公司正在开发一种使用 XGBoost 算法的新机器学习模型。该公司将在存储于 Amazon S3 存储桶中的数据上训练该模型。这些数据采用嵌套 JSON 格式。一名机器学习工程师需要将这些 JSON 文件转换为表格格式。哪种解决方案能够以最少的运维开销满足此要求?

答案: A

解析: AWS Glue 提供了一个名为“Relationalize”的内置转换功能,专门用于将嵌套的 JSON 结构展平为适合机器学习工作流的表格格式。使用 AWS Glue PySpark 作业可以利用托管服务,相比编写和管理自定义代码(如选项 B 和 C)或依赖 Athena 有限的转换能力(选项 D),能最大程度地减少运维开销。Athena 虽然可以查询嵌套 JSON,但没有像 Glue 的 Relationalize 转换那样能够完全关系化深度嵌套数据的原生“flatten”函数。因此,选项 A 在有效满足需求的同时,提供了最少的运维开销。
第 2 题 · 题号 185 · 单选

一家公司正在使用 Amazon S3 存储桶来收集将用于机器学习工作流的数据。该公司需要使用 AWS Glue DataBrew 来清洗和规范化这些数据。哪种解决方案能够满足这些要求?

答案: B

解析: AWS Glue DataBrew 支持直接使用 S3 路径从 Amazon S3 创建数据集。要清理和标准化数据,DataBrew 使用“配方作业(recipe jobs)”,该作业会应用在配方中定义的一系列数据转换步骤。配置文件作业(profile jobs)用于分析和理解数据(例如生成统计信息),而不是执行转换。此外,JDBC 驱动程序不用于连接 S3 存储桶,因为 S3 是对象存储服务,而非关系型数据库。因此,选项 B 是正确的解决方案。
第 3 题 · 题号 186 · 单选

一家公司将训练数据以 CSV 文件形式存储在 Amazon S3 存储桶中。该公司必须对数据进行加密,并且必须控制哪些应用程序可以访问加密密钥。哪种解决方案能够满足这些要求?

答案: D

解析: 需求明确指出数据必须加密,并且公司必须控制哪些应用程序可以访问加密密钥。AWS KMS(密钥管理服务)正是为此目的而设计的——它允许对加密密钥进行集中控制,并通过IAM策略实现细粒度的访问管理。选项D正确地建议创建一个新的AWS KMS密钥,并使用AWS加密CLI引用该KMS密钥来加密文件,从而同时满足数据加密和密钥访问控制的要求。其他选项均不正确:SSH密钥(A)不用于S3中的数据加密;API Gateway生成的API密钥(B)用于API身份验证,而非加密;虽然IAM角色(C)可用于授予使用KMS密钥的权限,但该选项并未提及创建KMS密钥本身,而这是加密所必需的。
第 4 题 · 题号 187 · 单选

一家公司希望构建一个实时分析应用程序,该程序使用来自社交媒体的流数据。一名机器学习工程师必须实施一种解决方案,每分钟摄取并转换5GB的数据。该解决方案还必须将数据加载到支持快速查询以进行实时分析的数据存储中。哪种解决方案能够满足这些要求?

答案: D

解析: 选项 D 是最佳选择,因为它使用了专为高吞吐量实时数据流(每分钟 5 GB)摄入而设计的 Amazon Kinesis Data Streams。Amazon Managed Service for Apache Flink(原 Kinesis Data Analytics)专用于实时流数据处理和转换。最后,Amazon DynamoDB 是一个完全托管的 NoSQL 数据库,支持快速、低延迟的查询,非常适合实时分析应用。其他选项所使用的服务并不适合高吞吐量实时流处理:EventBridge、SQS 和 SNS 并非为持续高容量数据摄入设计;ElastiCache 是内存缓存,不是持久化且可查询的数据存储;S3 是对象存储,不适合快速交互式查询;RDS 是关系型数据库,在面对高速、灵活模式的流式工作负载时可能无法有效扩展。
第 5 题 · 题号 188 · 单选

一家公司已在生产端点上部署了现有的 Amazon SageMaker 模型(v1)。该公司开发了一个新模型版本(v2),需要在将 v2 替换 v1 之前,在生产环境中对 v2 进行测试。公司需要实施一种解决方案,以尽量降低 v2 在生产环境中生成错误输出的风险。该解决方案必须确保在切换到 v2 的过程中不会中断生产流量。哪种解决方案能够满足这些要求?

答案: D

解析: 选项 D 使用了 SageMaker 的影子变体(shadow variant)功能,允许 v2 接收 100% 的生产流量副本,而不会影响实际发送给客户端的响应(这些响应仍来自 v1)。这使得可以在真实生产条件下全面测试 v2,同时确保对用户零干扰。v2 的所有输出都可以被捕获并分析其正确性,然后再将其提升为生产版本。选项 A 和 B 使用流量分割,即使只有 1% 或 10% 的流量,也会将 v2 可能不正确的预测结果发送给真实用户,存在风险。选项 C 将 v2 部署到一个新端点,并手动重定向流量,无法保证输入条件完全一致,且在切换过程中可能带来操作复杂性和潜在中断。因此,D 是最安全、最有效的方案。
第 6 题 · 题号 189 · 单选

一家公司正在使用 Amazon SageMaker、AWS 自有库和开源库构建机器学习模型。该公司必须确保 SageMaker 在训练过程中不收集有关使用情况和错误的元数据。哪种解决方案可以满足这些要求?

答案: D

第 7 题 · 题号 190 · 单选

一名机器学习工程师正在训练一个机器学习模型,以根据20个特征和1个目标来识别人们的健康风险。该目标类别包含两个取值: • 可能存在健康风险(正类) • 不太可能存在健康风险(负类) 数据集中人员的年龄范围为30岁至60岁,年龄是其中一个特征。该机器学习工程师对特征进行了分析,发现在正类中,40至45岁年龄段的标签比例差异(DPL)值为+0.9,与其他所有年龄段相比存在显著偏差。 该机器学习工程师应如何纠正这种数据不平衡问题?

答案: B

解析: 40至45岁年龄段的正类标签比例差异(DPL)值为+0.9,表明该子群体中的正类样本显著过多,相比其他年龄段存在偏差或不平衡。这可能导致模型对40至45岁人群过度预测为高健康风险。为纠正这种不平衡,工程师应减少该子群体的主导性,即对该年龄段的正类样本进行欠采样,因此选择选项B。
第 8 题 · 题号 191 · 多选

一家公司希望推出一个新的内部生成式AI界面来回答用户问题。该界面将基于一个流行的开源大语言模型(LLM)。以下哪两个步骤组合能以最少的运维开销部署该界面?(选择两项。)

答案: A, E

第 9 题 · 题号 192 · 单选

一家公司在 Amazon SageMaker 上运行一个机器学习模型。该公司使用一个自动化流程,通过 API 调用来创建该模型的训练作业。公司制定了新的合规规则,禁止收集训练作业的聚合元数据。哪种解决方案可以防止 SageMaker 从训练作业中收集元数据?

答案: A

解析: 该问题要求找到一种防止 Amazon SageMaker 从训练作业中收集聚合元数据的解决方案。选项 A 通过选择退出元数据跟踪直接解决了这一问题,这是 SageMaker 提供的一项功能,可用于禁用出于合规或隐私原因而收集的使用指标和元数据。其他选项——使用私有子网(B)、使用 KMS 加密数据(C)或使用 Nitro 实例(D)——分别涉及网络隔离、数据安全和硬件特性,但都无法阻止 SageMaker 收集有关训练作业本身的元数据。
第 10 题 · 题号 193 · 单选

一家公司需要使用 Amazon SageMaker 对超过 300 GB 的数据进行模型训练。训练数据由大小为 200 MB 的文件组成,这些数据存储在 Amazon S3 标准存储中,并为一个仪表板工具提供数据。在此场景下,哪种 SageMaker 训练数据摄入机制最具成本效益?

答案: D

12345 下一页