MLA-C01 题库 · 最新 50 题免费预览(第 1/5 页)
MLA-C01(AWS Certified Machine Learning Engineer Associate (MLA))最新题库第 1–10 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 233 题。
第 1 题 · 题号 184 · 单选
一家公司正在开发一种使用 XGBoost 算法的新机器学习模型。该公司将在存储于 Amazon S3 存储桶中的数据上训练该模型。这些数据采用嵌套 JSON 格式。一名机器学习工程师需要将这些 JSON 文件转换为表格格式。哪种解决方案能够以最少的运维开销满足此要求?
- A. 创建一个使用 Relationalize 转换来转换文件的 AWS Glue PySpark 作业。
- B. 编写自定义 Scala 代码来转换文件。使用 Amazon EMR Serverless 运行该 Scala 代码。
- C. 创建一个使用 Python 运行时的 AWS Lambda 函数,该函数调用 reduce() 函数来转换文件。然后调用该 Lambda 函数。
- D. 创建一个基于 JSON 文件的 Amazon Athena 数据库。使用 Athena 的 flatten 函数转换数据。
答案: A
解析: AWS Glue 提供了一个名为“Relationalize”的内置转换功能,专门用于将嵌套的 JSON 结构展平为适合机器学习工作流的表格格式。使用 AWS Glue PySpark 作业可以利用托管服务,相比编写和管理自定义代码(如选项 B 和 C)或依赖 Athena 有限的转换能力(选项 D),能最大程度地减少运维开销。Athena 虽然可以查询嵌套 JSON,但没有像 Glue 的 Relationalize 转换那样能够完全关系化深度嵌套数据的原生“flatten”函数。因此,选项 A 在有效满足需求的同时,提供了最少的运维开销。
第 2 题 · 题号 185 · 单选
一家公司正在使用 Amazon S3 存储桶来收集将用于机器学习工作流的数据。该公司需要使用 AWS Glue DataBrew 来清洗和规范化这些数据。哪种解决方案能够满足这些要求?
- A. 通过使用 S3 路径创建一个 DataBrew 数据集。使用 DataBrew 配置文件作业对数据进行清洗和标准化。
- B. 通过使用 S3 路径创建一个 DataBrew 数据集。使用 DataBrew 配方作业对数据进行清洗和标准化。
- C. 通过使用 Java 数据库连接(JDBC)驱动程序连接到 S3 存储桶,创建一个 DataBrew 数据集。然后使用 DataBrew 配置文件作业对数据进行清洗和标准化。
- D. 通过使用 Java 数据库连接(JDBC)驱动程序连接到 S3 存储桶,创建一个 DataBrew 数据集。然后使用 DataBrew 方案作业对数据进行清洗和标准化。
答案: B
解析: AWS Glue DataBrew 支持直接使用 S3 路径从 Amazon S3 创建数据集。要清理和标准化数据,DataBrew 使用“配方作业(recipe jobs)”,该作业会应用在配方中定义的一系列数据转换步骤。配置文件作业(profile jobs)用于分析和理解数据(例如生成统计信息),而不是执行转换。此外,JDBC 驱动程序不用于连接 S3 存储桶,因为 S3 是对象存储服务,而非关系型数据库。因此,选项 B 是正确的解决方案。
第 3 题 · 题号 186 · 单选
一家公司将训练数据以 CSV 文件形式存储在 Amazon S3 存储桶中。该公司必须对数据进行加密,并且必须控制哪些应用程序可以访问加密密钥。哪种解决方案能够满足这些要求?
- A. 创建一个新的 SSH 访问密钥。使用 AWS Encryption CLI,并引用该新访问密钥来加密文件。
- B. 使用 Amazon API Gateway 的 CreateApiKey API 操作创建一个新的 API 密钥。使用 AWS CLI 并引用该新 API 密钥来加密文件。
- C. 创建一个新的 IAM 角色。附加一个允许 AWS Key Management Service(AWS KMS)执行 GenerateDataKey 操作的策略。使用该角色对文件进行加密。
- D. 创建一个新的 AWS Key Management Service(AWS KMS)密钥。使用 AWS Encryption CLI 并引用该新的 KMS 密钥来加密文件。
答案: D
解析: 需求明确指出数据必须加密,并且公司必须控制哪些应用程序可以访问加密密钥。AWS KMS(密钥管理服务)正是为此目的而设计的——它允许对加密密钥进行集中控制,并通过IAM策略实现细粒度的访问管理。选项D正确地建议创建一个新的AWS KMS密钥,并使用AWS加密CLI引用该KMS密钥来加密文件,从而同时满足数据加密和密钥访问控制的要求。其他选项均不正确:SSH密钥(A)不用于S3中的数据加密;API Gateway生成的API密钥(B)用于API身份验证,而非加密;虽然IAM角色(C)可用于授予使用KMS密钥的权限,但该选项并未提及创建KMS密钥本身,而这是加密所必需的。
第 4 题 · 题号 187 · 单选
一家公司希望构建一个实时分析应用程序,该程序使用来自社交媒体的流数据。一名机器学习工程师必须实施一种解决方案,每分钟摄取并转换5GB的数据。该解决方案还必须将数据加载到支持快速查询以进行实时分析的数据存储中。哪种解决方案能够满足这些要求?
- A. 使用 Amazon EventBridge 摄取社交媒体数据。使用 AWS Glue 转换数据。将转换后的数据存储在 Amazon ElastiCache(Memcached)中。
- B. 使用 Amazon Simple Queue Service(Amazon SQS)接收社交媒体数据,使用 AWS Lambda 转换数据,并将转换后的数据存储在 Amazon S3 中。
- C. 使用 Amazon Simple Notification Service(Amazon SNS)摄取社交媒体数据。使用 Amazon EMR 转换数据。将转换后的数据存储在 Amazon RDS 中。
- D. 使用 Amazon Kinesis Data Streams 摄取社交媒体数据。使用 Amazon Managed Service for Apache Flink 转换数据。将转换后的数据存储在 Amazon DynamoDB 中。
答案: D
解析: 选项 D 是最佳选择,因为它使用了专为高吞吐量实时数据流(每分钟 5 GB)摄入而设计的 Amazon Kinesis Data Streams。Amazon Managed Service for Apache Flink(原 Kinesis Data Analytics)专用于实时流数据处理和转换。最后,Amazon DynamoDB 是一个完全托管的 NoSQL 数据库,支持快速、低延迟的查询,非常适合实时分析应用。其他选项所使用的服务并不适合高吞吐量实时流处理:EventBridge、SQS 和 SNS 并非为持续高容量数据摄入设计;ElastiCache 是内存缓存,不是持久化且可查询的数据存储;S3 是对象存储,不适合快速交互式查询;RDS 是关系型数据库,在面对高速、灵活模式的流式工作负载时可能无法有效扩展。
第 5 题 · 题号 188 · 单选
一家公司已在生产端点上部署了现有的 Amazon SageMaker 模型(v1)。该公司开发了一个新模型版本(v2),需要在将 v2 替换 v1 之前,在生产环境中对 v2 进行测试。公司需要实施一种解决方案,以尽量降低 v2 在生产环境中生成错误输出的风险。该解决方案必须确保在切换到 v2 的过程中不会中断生产流量。哪种解决方案能够满足这些要求?
- A. 为 v2 创建第二个生产变体。将 1% 的流量分配给 v2,99% 的流量分配给 v1。将 v2 的所有输出收集到一个 Amazon S3 存储桶中。如果 v2 表现符合预期,则将全部流量切换到 v2。
- B. 为 v2 创建第二个生产变体。将 10% 的流量分配给 v2,90% 的流量分配给 v1。将 v2 的所有输出收集到一个 Amazon S3 存储桶中。如果 v2 表现符合预期,则将全部流量切换至 v2。
- C. 将 v2 部署到一个新的端点。为生产端点启用数据捕获功能。编写一个脚本,将 100% 的输入数据发送至 v2。如果 v2 表现符合预期,则停用 v1 端点,并将流量全部导向 v2。
- D. 将 v2 部署到一个影子变体中,该变体对 100% 的推理请求进行采样。将所有输出收集到一个 Amazon S3 存储桶中。如果 v2 表现符合预期,则将其提升至生产环境。
答案: D
解析: 选项 D 使用了 SageMaker 的影子变体(shadow variant)功能,允许 v2 接收 100% 的生产流量副本,而不会影响实际发送给客户端的响应(这些响应仍来自 v1)。这使得可以在真实生产条件下全面测试 v2,同时确保对用户零干扰。v2 的所有输出都可以被捕获并分析其正确性,然后再将其提升为生产版本。选项 A 和 B 使用流量分割,即使只有 1% 或 10% 的流量,也会将 v2 可能不正确的预测结果发送给真实用户,存在风险。选项 C 将 v2 部署到一个新端点,并手动重定向流量,无法保证输入条件完全一致,且在切换过程中可能带来操作复杂性和潜在中断。因此,D 是最安全、最有效的方案。
第 6 题 · 题号 189 · 单选
一家公司正在使用 Amazon SageMaker、AWS 自有库和开源库构建机器学习模型。该公司必须确保 SageMaker 在训练过程中不收集有关使用情况和错误的元数据。哪种解决方案可以满足这些要求?
- A. 将 SageMaker 域关联到一个自定义 IAM 角色,并将该角色附加一个拒绝 Amazon CloudWatch 服务使用日志的策略。
- B. 向 SageMaker 域添加一个 IAM 角色,以拒绝 Amazon CloudWatch 报告元数据的权限。
- C. 关闭 SageMaker 域中用于共享控制台作业元数据的设置。对于通过 AWS CLI 或 AWS SDK 提交的每个训练作业,选择退出元数据收集。
- D. 为通过 AWS CLI、Boto3 或 SageMaker Python SDK 提交的每个训练任务设置一个参数,以选择退出元数据收集。
答案: D
第 7 题 · 题号 190 · 单选
一名机器学习工程师正在训练一个机器学习模型,以根据20个特征和1个目标来识别人们的健康风险。该目标类别包含两个取值:
• 可能存在健康风险(正类)
• 不太可能存在健康风险(负类)
数据集中人员的年龄范围为30岁至60岁,年龄是其中一个特征。该机器学习工程师对特征进行了分析,发现在正类中,40至45岁年龄段的标签比例差异(DPL)值为+0.9,与其他所有年龄段相比存在显著偏差。
该机器学习工程师应如何纠正这种数据不平衡问题?
- A. 对年龄在40至45岁之间的正类样本进行过采样。
- B. 对年龄在40至45岁之间的正类进行欠采样。
- C. 对除40至45岁以外的所有年龄段的正类进行欠采样。
- D. 对除40至45岁以外的所有年龄段的负类进行过采样。
答案: B
解析: 40至45岁年龄段的正类标签比例差异(DPL)值为+0.9,表明该子群体中的正类样本显著过多,相比其他年龄段存在偏差或不平衡。这可能导致模型对40至45岁人群过度预测为高健康风险。为纠正这种不平衡,工程师应减少该子群体的主导性,即对该年龄段的正类样本进行欠采样,因此选择选项B。
第 8 题 · 题号 191 · 多选
一家公司希望推出一个新的内部生成式AI界面来回答用户问题。该界面将基于一个流行的开源大语言模型(LLM)。以下哪两个步骤组合能以最少的运维开销部署该界面?(选择两项。)
- A. 使用 Amazon SageMaker JumpStart 部署大语言模型(LLM)。
- B. 将大语言模型(LLM)以 .zip 文件形式下载,并部署到基于 GPU 的 Amazon EC2 实例上。
- C. 创建一个前端 HTML 界面,使用 Amazon API Gateway WebSocket API 和 AWS Lambda 函数来处理用户交互。
- D. 使用 Amazon QuickSight 创建一个用于处理用户交互的界面。
- E. 使用 Amazon Lex 创建一个用于处理用户交互的界面。
答案: A, E
第 9 题 · 题号 192 · 单选
一家公司在 Amazon SageMaker 上运行一个机器学习模型。该公司使用一个自动化流程,通过 API 调用来创建该模型的训练作业。公司制定了新的合规规则,禁止收集训练作业的聚合元数据。哪种解决方案可以防止 SageMaker 从训练作业中收集元数据?
- A. 为提交的任何训练任务选择退出元数据跟踪。
- B. 确保训练任务在自定义VPC的私有子网中运行。
- C. 使用 AWS Key Management Service(AWS KMS)客户托管密钥对训练数据进行加密。
- D. 重新配置训练任务,仅使用 AWS Nitro 实例。
答案: A
解析: 该问题要求找到一种防止 Amazon SageMaker 从训练作业中收集聚合元数据的解决方案。选项 A 通过选择退出元数据跟踪直接解决了这一问题,这是 SageMaker 提供的一项功能,可用于禁用出于合规或隐私原因而收集的使用指标和元数据。其他选项——使用私有子网(B)、使用 KMS 加密数据(C)或使用 Nitro 实例(D)——分别涉及网络隔离、数据安全和硬件特性,但都无法阻止 SageMaker 收集有关训练作业本身的元数据。
第 10 题 · 题号 193 · 单选
一家公司需要使用 Amazon SageMaker 对超过 300 GB 的数据进行模型训练。训练数据由大小为 200 MB 的文件组成,这些数据存储在 Amazon S3 标准存储中,并为一个仪表板工具提供数据。在此场景下,哪种 SageMaker 训练数据摄入机制最具成本效益?
- A. Amazon Elastic File System(Amazon EFS)文件系统
- B. Amazon FSx for Lustre 文件系统
- C. 使用 S3 Express One Zone 时,Amazon S3 处于快速文件模式
- D. 在不使用 S3 Express One Zone 的情况下,以快速文件模式运行 Amazon S3
答案: D