重要
此功能目前为预览版。
Microsoft Fabric 允许您通过安全、可扩展且易用的在线终端,从机器学习模型中实时预测。 大多数 Fabric 模型都将这些端点作为内置属性,且无需设置即可启动全托管的实时部署。
可以使用 面向公众的 REST API 激活、配置和查询模型终结点。 你也可以直接从Fabric界面开始,使用低代码体验激活模型端点并即时预览预测。
先决条件
- 你的租户默认启用了机器学习模型端点。 如果管理员想要禁用此功能,他们可以在Fabric管理门户中关闭 ML 模型终结点的租户开关。
局限性
- 终结点目前可用于一组有限的 ML 模型风格,包括 Keras、LightGBM、Sklearn 和 XGBoost。
- 终结点目前不适用于具有张量架构的模型或没有架构的模型。
注释
机器学习端点支持AutoML训练模型。
模型终结点入门
Fabric中的机器学习模型预装了在线端点,你可以用来提供实时预测。 每个注册型号版本都有专用端点URL,您可以在Fabric界面的端点详情栏目中找到。 该 URL 结尾有一个子路径,指定具体版本(例如, /versions/1/score)。
模型终结点具有以下属性:
| 财产 | 说明 | 默认 |
|---|---|---|
| 默认版本 | 该性质(Yes 或 No)表示该版本是否被设定为模型默认的真实预测服务。 可以在模型设置中 自定义默认版本 。 |
No |
| Status | 此属性指示终结点是否准备好提供预测。 状态可以是Inactive、Activating、Active或DeactivatingFailed。 只有活动终结点才能提供预测。 |
Inactive |
| 自动睡眠 | 此属性 (On 或 Off) 指示终结点在缺少流量的情况下是否应将容量使用量缩减为零。 如果启用了自动睡眠,端点在五分钟内没有传入请求后会进入空闲状态。 唤醒空闲终结点的第一次调用涉及短暂延迟。 |
On |
激活模型终结点
可以直接从Fabric接口激活模型终结点。 进入你想用于实时预测的版本,从功能区选择 激活版本端点 。
Toast 消息显示,Fabric 正在使你的端点准备就绪,以提供预测服务,端点状态将更改为 Activating。 在幕后,Fabric 启动了底层的容器基础设施来托管你的模型。 几分钟之内,终端节点即可提供预测。
每个端点都有一个状态,指示是否准备好提供实时预测:
| Status | 说明 |
|---|---|
Inactive |
该终端不会被激活来提供实时预测,也不会消耗 Fabric 的容量。 |
Activating |
终结点正在被配置为提供实时预测。 在后台,Fabric设置底层容器基础结构来托管模型。 几分钟内,终结点处于活动状态。 |
Active |
终结点已准备好提供实时预测。 在后台,Fabric管理底层基础结构,根据传入流量纵向扩展资源使用情况。 流量越高,Fabric容量使用率越高。 |
Deactivating |
该终结点正在停用,因此不再提供实时预测服务,也不再消耗 Fabric 容量。 在幕后,Fabric 分解了底层容器基础设施。 |
注释
ML 模型可以同时支持最多五个版本的活动终结点。 若要从第六个版本提供预测,必须先 停用活动终结点。
管理模型终结点
要查看模型当前活跃端点的概览,请在界面中选择 “管理端点 ”。 每个模型都有一个可自定义的默认终结点,该终结点提供你选择的版本中的预测。 你可以在设置面板里用下拉选择器更新默认版本。
重要
如果你打算用,可以把默认属性设置为激活版本。 如果你没有设置默认属性,或者将其设置为非活跃版本,调用默认端点就会失败。
模型的端点设置列出了所有具有活跃端点的版本。 你可以将开关切换为 开 或 关,以修改各个端点的自动睡眠属性。
小窍门
开启自动睡眠的活跃终端在无流量五分钟后进入空闲状态。 第一次叫醒他们需要短暂的延迟。 你可能需要为生产环境中的端点关闭此属性。
用于实时预测的查询模型终结点
你可以通过 Fabric 中的低代码体验即时测试模型端点。 进入一个有活跃端点的版本,在界面功能区选择 预览预测 。 你可以向端点发送样本请求,通过使用与模型输入签名匹配的表单字段实时获取样本预测。
选择 自动填充 ,以填充表单字段中的随机样本值。 你可以添加更多组表单值,以使用多组输入测试该端点。 选择 获取预测, 将你的样本请求发送给端点。
如果希望将示例请求的格式设置为 JSON 有效负载,请使用下拉列表选择器更改视图。
停用模型终结点
可以直接从Fabric界面停用模型终端。 切换到一个不再需要实时预测的版本,然后在界面功能区选择 “停用版本端点 ”。
系统会显示一条通知消息,表明 Fabric 正在拆除你的活动部署,端点状态会更改为 Deactivating。 端点无法提供实时预测,除非你重新激活它。
可以从模型的设置窗格中一次性停用该模型的不同版本的多个端点。 在界面中选择 “管理端点 ”,然后选择一个或多个激活端点来停用。
消耗率
托管活动模型终结点消耗Fabric容量单位(OU)。 终结点在计算节点上运行,可以根据传入流量自动扩展到三个节点。 终结点处于活动状态时,按节点计算计费。 下表显示了活跃机器学习模型端点的CU消耗情况。
| 运算 | 操作度量单位 | 消耗率 |
|---|---|---|
| 模型端点 | 每个节点每秒 1 个模型端点(版本) | 5 CU 秒 |
下表展示了示例情景及其对应的消耗率和小时成本。
| 情景 | 说明 | 消耗率 | 每小时成本 |
|---|---|---|---|
| 具有非活动终结点的模型 | 这些模型没有活动版本终结点,也没有关联的资源利用率。 它们不涉及额外费用。 | 0 CU 秒 | 0 CU 小时 |
| 具有活动终结点但空闲终结点的模型 | 这些模型有一个或多个活跃版本端点,但如果没有定期流量,所有端点都会扩展到零,从而自动降低成本。 | 5 CU 秒 | 0.42 CU 小时数 |
| 具有 1 个活动终结点和恒定低流量的模型 | 这些模型仅有一个活跃版本的端点用于预测服务,但没有足够的流量来触发完全扩容。一个节点可以满足所有流量需求。 其他版本端点可能处于非活跃或空闲状态。 | 5 CU 秒 | 5 CU 小时 |
| 具有 1 个活动终结点和恒定高流量的模型 | 这些模型只有一个活跃版本端点提供预测,且流量足以触发全面扩展。其他版本端点可能处于非活跃或空闲状态。 | 15 CU 秒 | 15 学分(CU)小时 |
| 具有 5 个活动终结点和恒定高流量的模型 | 这些模型有 5 个活动版本端点(当前限制)提供预测,每个端点都有足以触发完全横向扩展的流量。 | 75 CU秒 | 75 CU 小时 |
Fabric容量指标应用在名称“模型终结点”下显示模型终结点操作的总容量使用情况。 此外,用户还可以在“机器学习模型端点容量使用CU”下查看其模型端点使用计费摘要。
模型终结点操作被分类为 后台操作。
消耗率可能会随时更改。 Microsoft使用合理的努力通过电子邮件或通过产品内通知提供通知。 变更自 Microsoft 发布说明或 Microsoft Fabric 博客中所述日期生效。 如果对 Fabric 消耗率中的模型端点进行任何更改,导致所需的容量单位(CU)显著增加,客户可以选择适用于所选付款方式的取消选项。
相关内容
- 通过机器学习 模型端点REST API程序化管理和查询端点。
- 从 数据流 Gen2 调用模型终结点进行实时数据扩充。
- 通过使用
PREDICTFabric 笔记本中的函数生成批量预测。 - 在 Fabric 中详细了解 模型训练和实验。
- 我们错过了所需的功能吗? 请在Fabric Ideas 论坛上提出建议。