Data-Science-For-Beginners 实战任务:在 Azure ML 上以低代码/无代码方式完成数据科学项目(AutoML 训练、部署与端点调用)
发布时间:2026/9/11 8:19:09 锦皓数字建站
`)
Data-Science-For-Beginners 实战任务在 Azure ML 上以低代码/无代码方式完成数据科学项目AutoML 训练、部署与端点调用【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本指南围绕 Data-Science-For-Beginners 课程第 18 课5-Data-Science-In-Cloud/18-Low-Code的课后作业Assignment展开任务核心是自主寻找数据集在 Azure Machine Learning 平台上以**低代码/无代码Low code/No code**方式完成模型训练、部署与端点消费的全流程。读完本文你将掌握从创建 Azure ML 工作区、配置计算集群、上传并清洗数据到使用 AutoML 训练模型、审查模型解释、部署 Web 服务并调用 REST 端点的完整实战方法同时能依据官方评分标准自我验收作业成果。任务总览这份 Assignment 要求你做什么课程在 README.md 中演示了如何用 Azure ML 平台以低代码/无代码方式训练、部署并消费一个“心力衰竭预测”模型。随后的 assignment.md 给出了明确的任务指令我们已经学习了如何使用 Azure ML 平台以低代码/无代码的方式训练、部署和使用模型。现在请寻找一些可以用来训练另一个模型的数据部署并使用它。你可以在Kaggle和Azure Open Datasets上查找数据集。把这个任务拆解开共包含四个可验收的动作找到一份数据集Kaggle 或 Azure Open Datasets 均可以低代码/无代码方式训练一个模型复用课程中的 AutoML 工作流部署最佳模型为可调用的 Web 服务成功消费该端点向 REST 端点发送数据并拿到预测结果。任务没有限定主题与算法给了学习者充分的自主空间但验收标准评分标准对数据质量处理、AutoML 流程完整性、模型解释审查和端到端可消费性都有明确要求下文将逐一展开。背景回顾低代码/无代码与 Azure ML SDK 两条路线课程中 project-schema 架构图 清晰地展示了同一数据科学项目以心力衰竭预测为例的两条实现路径低代码/无代码路线在 Studio 图形界面中操作与Azure ML SDK 路线编写代码实现。两条路线各有优劣课程的对比结论如下见 README.md维度低代码/无代码Azure ML SDK代码能力要求不需要需要开发耗时快速、简单取决于代码熟练度生产就绪否是低代码/无代码方式通过 GUI图形用户界面交互无需任何编码基础适合快速验证项目可行性、产出概念验证POC但当项目规模化、需要生产级交付时单纯依赖 GUI 难以应对必须用代码自动完成从资源创建到模型部署的一切环节这正是 Azure ML SDK 的价值所在。本作业要求你走的正是前一条路线——低代码/无代码因此你的交付物主要是 Azure ML Studio 中的一系列操作结果而非代码。第一步寻找并准备数据集数据从哪里找作业明确推荐了两个数据源Kaggle公开数据集社区覆盖面广表格类、图像类、文本类数据都很丰富Azure Open Datasets微软 Azure 官方维护的公开数据集目录多为经过整理的结构化数据质量相对稳定。建议优先选择表格型tabular数据因为课程演示的 AutoML 分类流程针对的是结构化特征 目标列的监督学习场景表格数据可直接复用课程模板且便于执行“修改特征类型”和“数据清洗”等评分要求。参考样例Heart Failure 数据集的结构课程以 Kaggle 的 Heart Failure 临床数据集作为样例README.md这是一个包含13 列12 个特征 1 个目标变量和 299 行的表格数据集用于预测患者随访期内是否发生死亡事件。其字段结构可以为你选择/评估自己的数据集提供参照变量名类型描述示例age数值型患者年龄25anaemia布尔型是否贫血红细胞或血红蛋白减少0 或 1creatinine_phosphokinase数值型血液中 CPK 酶的水平542diabetes布尔型患者是否患糖尿病0 或 1ejection_fraction数值型每次收缩时离开心脏的血液百分比45high_blood_pressure布尔型患者是否有高血压0 或 1platelets数值型血液中的血小板数量149000serum_creatinine数值型血液中血清肌酐水平0.5serum_sodium数值型血液中血清钠水平junsex布尔型性别0 或 1smoking布尔型患者是否吸烟0 或 1time数值型随访期天4DEATH_EVENT [目标]布尔型随访期内患者是否死亡0 或 1注意其中的规律布尔型特征与目标变量成对出现如 anaemia、diabetes、high_blood_pressure、sex、smoking 都是 0/1 二值这直接决定了下一步上传数据时的 Schema 修正工作。你自己的数据集未必是二分类也可能是多分类或回归问题但务必明确哪一列是目标列、哪些是特征列。第二步搭建 Azure ML 工作区与计算资源创建 Azure ML 工作区工作区Workspace是 Azure Machine Learning 的顶层资源集中管理你在使用 Azure ML 过程中产生的所有资产它会保存所有训练运行的历史记录日志、指标、输出、脚本快照你可以据此判断哪次训练运行产出了最佳模型。创建步骤如下详见 README.md使用与 Azure 订阅关联的 Microsoft 凭据登录 Azure 门户选择Create a resource搜索 Machine Learning 并选择 Machine Learning 磁贴点击创建按下表填写设置配置项说明Subscription你的 Azure 订阅Resource group新建或选择资源组Workspace name为工作区输入唯一名称Region选择离你最近的地理区域Storage account记录将为工作区创建的默认新存储账户Key vault记录将为工作区创建的默认新密钥保管库Application insights记录将为工作区创建的默认新 Application Insights 资源Container registryNone首次将模型部署到容器时会自动创建点击审阅 创建再点击创建等待数分钟完成创建在工作区概览页启动 Azure Machine Learning Studio或新开浏览器访问 ml.azure.com用 Microsoft 账户登录必要时选择你的 Azure 目录、订阅和工作区在 Studio 中点击左上角 ☰ 图标即可浏览界面中的各个页面用它们管理工作区资源。有两个实用注意事项浏览器兼容性——建议使用最新版 Microsoft Edge非 legacy 版、Chrome、Firefox或 Mac 上的最新版 Safari费用提示——只要工作区存在于订阅中就会产生少量数据存储费用因此课程明确建议不再使用工作区时务必删除它。计算资源四种类型计算资源是用于运行模型训练与数据探索过程的云端资源Azure ML 支持四种计算实例Compute Instances数据科学家使用的开发工作站本质是创建一台虚拟机并启动 Notebook 实例可在 Notebook 中调用计算集群训练模型计算集群Compute Clusters按需处理实验代码的可扩展 VM 集群训练模型时需要它可选用专用 GPU 或 CPU 资源推理集群Inference Clusters部署预测服务的目标资源承载训练好的模型附加计算Attached Compute关联 Azure 中已有的计算资源如虚拟机或 Azure Databricks 集群。对于本作业训练模型需要的是计算集群。关键选型决策四组权衡创建计算资源时有四组选择会对成本与效果产生决定性影响README.mdCPU 还是 GPUCPU 适合快速处理多种任务但并发有限GPU 专为并行计算设计深度学习任务表现远优于 CPU。选择建议如下CPUGPU更便宜更贵并发度较低并发度更高训练深度学习模型较慢深度学习的最佳选择集群规模Cluster Size更大的集群更贵但响应更快。时间充裕而预算紧张从小集群起步反之预算充足而时间紧张则从大集群起步。VM 规格VM Size可调整内存、磁盘、核心数与时钟频率参数越高成本越高、性能越好按时间与预算约束权衡。专用实例还是低优先级实例Dedicated vs Low-Priority低优先级实例可被中断——Azure 可能回收资源分配给其他任务从而中断你的作业专用实例不可中断在未经你许可的情况下绝不会被终止。可中断实例更便宜这是又一组时间 vs 金钱的权衡。创建计算集群的操作步骤在 Studio 中点击Compute菜单 →Compute cluster标签页 → New按钮选择选项专用/低优先级、CPU/GPU、VM 规格与核心数本作业可使用默认设置点击 Next为集群输入计算名称配置最小/最大节点数、缩容前的空闲秒数、SSH 访问。最小节点数设为 0 可在集群空闲时省钱最大节点数越大训练时间越短课程推荐最大节点数不超过 3点击Create可能需要几分钟。第三步上传数据集并修正特征类型计算集群就绪后把数据集加载进 Azure ML StudioREADME.md在左侧菜单点击Datasets→ Create dataset选择From local files选中你下载的数据集文件为数据集命名、指定类型并填写描述点击 Next从文件上传数据点击 Next在Schema中将以下特征的数据类型改为布尔型Booleananaemia、diabetes、high_blood_pressure、sex、smoking以及目标列DEATH_EVENT点击 Next 并点击 Create。这一步正是评分标准中“上传数据时如果有必要你注意更改了特征的类型”的落点——特征类型修正确保 AutoML 以正确的语义解读每个字段0/1 二值字段应为布尔型而非数值型。如果你选择的数据集存在缺失值、重复行或明显异常值还应在此阶段完成数据清洗这对应评分标准中的“对数据进行了清理如果需要”。第四步使用 AutoML 训练模型并审查模型解释传统机器学习模型开发资源密集需要大量领域知识与时间才能产出并比较几十个模型。**自动化机器学习AutoML**自动完成模型开发中耗时、重复的迭代任务让数据科学家、分析师和开发者以高扩展性、高效率构建 ML 模型同时保持模型质量显著缩短到达生产级模型的时间README.md。在 Studio 中的操作步骤如下左侧菜单点击Automated ML选择刚上传的数据集点击 Next输入新的实验名称指定目标列target column课程示例为DEATH_EVENT和刚创建的计算集群点击 Next选择Classification分类并点击 Finish。这一步根据计算集群规模可能需要 30 分钟到 1 小时运行完成后点击Automated ML标签页 → 你的运行 → 在Best model summary卡片中点击算法名称。在最佳模型详情页你可以看到 AutoML 生成的最佳模型的详细描述也可以在Models标签页探索其他生成模型。务必花几分钟在Explanations预览中查看模型的解释信息——这对应评分标准中你检查了模型的解释。模型解释能告诉你哪些特征对预测贡献最大、模型决策的依据是什么是评估模型可信度与业务可解释性的关键步骤。第五步部署最佳模型为 Web 服务自动化机器学习界面支持用几步将最佳模型部署为 Web 服务README.md。部署意味着集成模型使其能基于新数据做出预测——在心力衰竭案例中部署为 Web 服务意味着医疗应用可以调用模型实时预测患者发生心脏病的风险。在最佳模型描述页点击Deploy按钮然后填写名称、描述计算类型选择Azure Container InstanceACI启用认证enable authentication点击 Deploy。此步骤可能需要约 20 分钟部署过程包括注册模型、生成资源并为 Web 服务完成配置等若干环节。Deploy status 下会出现状态消息定期点击 Refresh 检查部署状态状态变为Healthy即表示已部署并运行部署完成后点击Endpoint标签页并点击刚部署的端点可在这里查看关于端点的所有详细信息。第六步消费端点调用 REST API点击Consume标签页可以看到REST 端点地址和一段Python 消费脚本README.md。该脚本可直接在本地机器上运行并调用你的端点。脚本中与端点通信的核心是这两行url http://98e3715f-xxxx-xxxx-xxxx-9ec22d57b796.centralus.azurecontainer.io/score api_key # Replace this with the API key for the web serviceurl变量Consume 页中显示的 REST 端点地址api_key变量Consume 页中显示的主键仅在你启用了认证的情况下需要——这正是脚本能够消费端点的凭据机制。运行脚本你会看到如下输出b{\\result\\: [true]}这表示对给定数据的心力衰竭预测结果为true。之所以如此是因为脚本自动生成的数据里所有字段默认都是 0 和 false。将data替换为下面这组包含真实临床特征分布的输入样本data { data: [ { age: 0, anaemia: false, creatinine_phosphokinase: 0, diabetes: false, ejection_fraction: 0, high_blood_pressure: false, platelets: 0, serum_creatinine: 0, serum_sodium: 0, sex: false, smoking: false, time: 0, }, { age: 60, anaemia: false, creatinine_phosphokinase: 500, diabetes: false, ejection_fraction: 38, high_blood_pressure: false, platelets: 260000, serum_creatinine: 1.40, serum_sodium: 137, sex: false, smoking: false, time: 130, }, ], }此时脚本应返回b{\\result\\: [true, false]}第一条样本全 0预测为true第二条样本更接近真实患者的生理指标组合预测为false说明模型正在基于输入特征的真实差异做出区分——这就是端点的“消费”闭环把结构化数据以 JSON 请求发送给部署好的模型拿到实时预测结果。如果你选择了自己的数据集只需按你的特征列名与数据类型构造同样的data字典即可。评分标准详解与自查清单作业附带的评分标准Rubric是验收的核心依据assignment.md三个档位的差别在于流程完整度与细节深度卓越Exemplary合格Adequate需要改进Needs Improvement上传数据时如果有必要你注意更改了特征的类型同时对数据进行了清理如果需要通过 AutoML 对数据集进行了训练并检查了模型的解释部署了最佳模型并成功使用了它。上传数据时如果有必要你注意更改了特征的类型通过 AutoML 对数据集进行了训练部署了最佳模型并成功使用了它。你部署了 AutoML 训练的最佳模型并成功使用了它。将其转化为可逐项勾选的验收清单可以帮助你在提交前自查数据准备阶段区分卓越与合格的关键上传数据集时是否按需修改了特征类型二值字段设为 Boolean数值字段设为数值型数据是否存在缺失值、重复行、异常值等需要清洗的问题是否已处理训练阶段是否通过 AutoML 对数据集完成了训练运行卓越档要求是否在 Explanations 中审查了模型解释理解了特征贡献与模型行为部署与消费阶段三档均要求是否部署了 AutoML 选出的最佳模型ACI 认证是否成功通过 REST 端点 API 密钥调用了模型并验证了返回的预测结果从表格可以清晰看出部署 消费是底线要求在此之上增加特征类型修改与AutoML 训练即为合格再补上数据清洗与模型解释审查才能达到卓越。对照此清单你就能明确自己当前成果所处的档位。挑战深入理解 AutoML 的模型解释课程在 Challenge 环节 提出了一个更高阶的思考任务强烈建议你在完成作业后一并完成仔细查看 AutoML 为最优模型生成的模型解释与细节试着理解为什么最佳模型优于其他模型。被比较的算法有哪些它们之间的差异是什么为什么在这个案例中最佳模型表现更好这要求你不止于“跑通流程”还要理解 AutoML 底层的算法竞赛逻辑AutoML 会同时评估多种算法如逻辑回归、决策树集成、梯度提升等与超参数组合依据验证指标选出冠军模型。结合 Explanations 页面你可以对比不同模型的特征重要性分布、弄清各类算法对非线性/缺失数据的不同假设从而回答“为什么它在当前数据集上胜出”。如果你还想对比 SDK 路线的实现细节可以对照课程第 19 课 19-Azure 的 SDK Notebook 查看同一任务的代码化实现。收尾清理资源与延伸阅读完成项目后不要忘记删除所有相关资源——包括 Azure ML 工作区、计算集群与已部署的端点以避免产生持续的费用课程在 README.md 中对此有明确提示。至此你已经以低代码/无代码方式在云端完成了一个端到端的数据科学项目选数据 → 建工作区 → 配计算 → 传数据含类型修正与清洗→ AutoML 训练 → 审查解释 → 部署 → 消费端点。这套工作流的意义在于它让没有编码背景的学习者也能快速验证一个数据科学想法的可行性并产出可用的预测服务而当你后续需要把项目推向生产环境时则可以在此基础上转向 Azure ML SDK 路线用代码把整个流程自动化——这正是课程所设计的进阶路径。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。