使用 ML 模型终结点提供实时预测(预览版)

重要

此功能目前为预览版

Microsoft Fabric 允许您通过安全、可扩展且易用的在线终端,从机器学习模型中实时预测。 大多数 Fabric 模型都将这些端点作为内置属性,且无需设置即可启动全托管的实时部署。

可以使用 面向公众的 REST API 激活、配置和查询模型终结点。 你也可以直接从Fabric界面开始,使用低代码体验激活模型端点并即时预览预测。

截图显示 Fabric 中的 ML 模型,其中包含用于进行实时预测的内置终结点属性.

先决条件

  • 你的租户默认启用了机器学习模型端点。 如果管理员想要禁用此功能,他们可以在Fabric管理门户中关闭 ML 模型终结点的租户开关

局限性

  • 终结点目前可用于一组有限的 ML 模型风格,包括 Keras、LightGBM、Sklearn 和 XGBoost。
  • 终结点目前不适用于具有张量架构的模型或没有架构的模型。

注释

机器学习端点支持AutoML训练模型。

模型终结点入门

Fabric中的机器学习模型预装了在线端点,你可以用来提供实时预测。 每个注册型号版本都有专用端点URL,您可以在Fabric界面的端点详情栏目中找到。 该 URL 结尾有一个子路径,指定具体版本(例如, /versions/1/score)。

显示 ML 模型终结点的属性的屏幕截图,该终结点可用于提供实时预测。

模型终结点具有以下属性:

财产 说明 默认
默认版本 该性质(YesNo)表示该版本是否被设定为模型默认的真实预测服务。 可以在模型设置中 自定义默认版本 No
Status 此属性指示终结点是否准备好提供预测。 状态可以是InactiveActivatingActiveDeactivatingFailed。 只有活动终结点才能提供预测。 Inactive
自动睡眠 此属性 (OnOff) 指示终结点在缺少流量的情况下是否应将容量使用量缩减为零。 如果启用了自动睡眠,端点在五分钟内没有传入请求后会进入空闲状态。 唤醒空闲终结点的第一次调用涉及短暂延迟。 On

激活模型终结点

可以直接从Fabric接口激活模型终结点。 进入你想用于实时预测的版本,从功能区选择 激活版本端点

屏幕截图显示如何从 Fabric 界面激活 ML 模型终结点。

Toast 消息显示,Fabric 正在使你的端点准备就绪,以提供预测服务,端点状态将更改为 Activating。 在幕后,Fabric 启动了底层的容器基础设施来托管你的模型。 几分钟之内,终端节点即可提供预测。

显示正在激活的 ML 模型终结点的屏幕截图。

每个端点都有一个状态,指示是否准备好提供实时预测:

Status 说明
Inactive 该终端不会被激活来提供实时预测,也不会消耗 Fabric 的容量。
Activating 终结点正在被配置为提供实时预测。 在后台,Fabric设置底层容器基础结构来托管模型。 几分钟内,终结点处于活动状态。
Active 终结点已准备好提供实时预测。 在后台,Fabric管理底层基础结构,根据传入流量纵向扩展资源使用情况。 流量越高,Fabric容量使用率越高。
Deactivating 该终结点正在停用,因此不再提供实时预测服务,也不再消耗 Fabric 容量。 在幕后,Fabric 分解了底层容器基础设施。

注释

ML 模型可以同时支持最多五个版本的活动终结点。 若要从第六个版本提供预测,必须先 停用活动终结点

管理模型终结点

要查看模型当前活跃端点的概览,请在界面中选择 “管理端点 ”。 每个模型都有一个可自定义的默认终结点,该终结点提供你选择的版本中的预测。 你可以在设置面板里用下拉选择器更新默认版本。

显示默认 ML 模型终结点 URL 的屏幕截图,可以配置该 URL 来提供特定版本的预测。

重要

如果你打算用,可以把默认属性设置为激活版本。 如果你没有设置默认属性,或者将其设置为非活跃版本,调用默认端点就会失败。

模型的端点设置列出了所有具有活跃端点的版本。 你可以将开关切换为 ,以修改各个端点的自动睡眠属性。

显示如何更改 ML 模型终结点上的自动睡眠属性的屏幕截图。

小窍门

开启自动睡眠的活跃终端在无流量五分钟后进入空闲状态。 第一次叫醒他们需要短暂的延迟。 你可能需要为生产环境中的端点关闭此属性。

用于实时预测的查询模型终结点

你可以通过 Fabric 中的低代码体验即时测试模型端点。 进入一个有活跃端点的版本,在界面功能区选择 预览预测 。 你可以向端点发送样本请求,通过使用与模型输入签名匹配的表单字段实时获取样本预测。

显示用于从活动 ML 模型终结点获取示例预测的内置预览体验的屏幕截图。

选择 自动填充 ,以填充表单字段中的随机样本值。 你可以添加更多组表单值,以使用多组输入测试该端点。 选择 获取预测, 将你的样本请求发送给端点。

显示用于将示例请求发送到活动 ML 模型终结点的基于表单的视图的屏幕截图。

如果希望将示例请求的格式设置为 JSON 有效负载,请使用下拉列表选择器更改视图。

显示用于将示例请求发送到活动 ML 模型终结点的基于 JSON 的视图的屏幕截图。

停用模型终结点

可以直接从Fabric界面停用模型终端。 切换到一个不再需要实时预测的版本,然后在界面功能区选择 “停用版本端点 ”。

截图展示如何通过 Fabric 界面停用 ML 模型终结点。

系统会显示一条通知消息,表明 Fabric 正在拆除你的活动部署,端点状态会更改为 Deactivating。 端点无法提供实时预测,除非你重新激活它。

显示正在停用的 ML 模型终结点的屏幕截图。

可以从模型的设置窗格中一次性停用该模型的不同版本的多个端点。 在界面中选择 “管理端点 ”,然后选择一个或多个激活端点来停用。

截图显示如何从 Fabric 界面一次性停用多个 ML 模型端点。

消耗率

托管活动模型终结点消耗Fabric容量单位(OU)。 终结点在计算节点上运行,可以根据传入流量自动扩展到三个节点。 终结点处于活动状态时,按节点计算计费。 下表显示了活跃机器学习模型端点的CU消耗情况。

运算 操作度量单位 消耗率
模型端点 每个节点每秒 1 个模型端点(版本) 5 CU 秒

下表展示了示例情景及其对应的消耗率和小时成本。

情景 说明 消耗率 每小时成本
具有非活动终结点的模型 这些模型没有活动版本终结点,也没有关联的资源利用率。 它们不涉及额外费用。 0 CU 秒 0 CU 小时
具有活动终结点但空闲终结点的模型 这些模型有一个或多个活跃版本端点,但如果没有定期流量,所有端点都会扩展到零,从而自动降低成本。 5 CU 秒 0.42 CU 小时数
具有 1 个活动终结点和恒定低流量的模型 这些模型仅有一个活跃版本的端点用于预测服务,但没有足够的流量来触发完全扩容。一个节点可以满足所有流量需求。 其他版本端点可能处于非活跃或空闲状态。 5 CU 秒 5 CU 小时
具有 1 个活动终结点和恒定高流量的模型 这些模型只有一个活跃版本端点提供预测,且流量足以触发全面扩展。其他版本端点可能处于非活跃或空闲状态。 15 CU 秒 15 学分(CU)小时
具有 5 个活动终结点和恒定高流量的模型 这些模型有 5 个活动版本端点(当前限制)提供预测,每个端点都有足以触发完全横向扩展的流量。 75 CU秒 75 CU 小时

Fabric容量指标应用在名称“模型终结点”下显示模型终结点操作的总容量使用情况。 此外,用户还可以在“机器学习模型端点容量使用CU”下查看其模型端点使用计费摘要。

模型终结点操作被分类为 后台操作

消耗率可能会随时更改。 Microsoft使用合理的努力通过电子邮件或通过产品内通知提供通知。 变更自 Microsoft 发布说明或 Microsoft Fabric 博客中所述日期生效。 如果对 Fabric 消耗率中的模型端点进行任何更改,导致所需的容量单位(CU)显著增加,客户可以选择适用于所选付款方式的取消选项。