Servir des prédictions en temps réel avec des points de terminaison de modèle ML (Aperçu)

Important

Cette fonctionnalité est en version préliminaire.

Microsoft Fabric vous permet de fournir des prédictions en temps réel à partir de modèles ML en utilisant des points de terminaison en ligne sécurisés, évolutifs et faciles à utiliser. La plupart des modèles Fabric incluent ces points de terminaison comme propriétés intégrées, et ils ne nécessitent aucune configuration pour lancer des déploiements en temps réel entièrement gérés.

Vous pouvez activer, configurer et interroger des points de terminaison de modèle à l’aide d’une API REST publique. Vous pouvez aussi commencer directement depuis l’interface Fabric en utilisant une expérience low-code pour activer instantanément les points de terminaison des modèles et prévisualiser les prédictions.

Screenshot montrant un modèle ML dans Fabric avec une propriété de point de terminaison intégrée pour servir des prédictions en temps réel.

Conditions préalables

Limites

  • Les endpoints sont actuellement disponibles pour un ensemble limité de types de modèles ML, notamment Keras, LightGBM, Sklearn et XGBoost.
  • Actuellement, les points de terminaison ne sont pas disponibles pour les modèles avec des schémas basés sur des tenseurs ou aucun schéma.

Remarque

Les terminaux d’apprentissage automatique prennent en charge les modèles entraînés par AutoML.

Commencez avec les points de terminaison du modèle

Les modèles ML dans Fabric sont préconstruits avec des points de terminaison en ligne que vous pouvez utiliser pour fournir des prédictions en temps réel. Chaque version de modèle enregistrée possède une URL dédiée au point de terminaison, que vous pouvez trouver sous l’en-tête Détails du point de terminaison dans l’interface Fabric. Cette URL se termine par un sous-chemin qui désigne la version spécifique (par exemple, /versions/1/score).

Capture d’écran montrant les propriétés d’un point de terminaison de modèle ML, qui peuvent être utilisées pour traiter des prédictions en temps réel.

Les points de terminaison de modèle ont les propriétés suivantes :

Propriété Description Par défaut
Version par défaut Cette propriété (Yes ou No) indique si la version est définie comme valeur par défaut du modèle pour servir les prédictions réelles. Vous pouvez personnaliser la version par défaut dans les paramètres du modèle. No
État Cette propriété indique si le point de terminaison est prêt à traiter les prédictions. L’état peut être Inactive, , ActivatingActive, Deactivatingou Failed. Seuls les points de terminaison actifs peuvent servir des prédictions. Inactive
Veille automatique Cette propriété (On ou Off) indique si le point de terminaison, une fois actif, doit réduire l’utilisation de la capacité à zéro en l’absence de trafic. Si la veille automatique est activée, le point de terminaison entre en état d’inactivité après cinq minutes sans aucune requête entrante. Le premier appel pour réveiller un point de terminaison inactif implique un court délai. On

Activer les points de terminaison de modèle

Vous pouvez activer des points de terminaison de modèle directement à partir de l’interface Fabric. Allez dans la version que vous souhaitez utiliser pour les prédictions en temps réel et sélectionnez Activer le point de terminaison de la version depuis le ruban.

Screenshot montrant comment activer un point de terminaison de modèle ML à partir de l’interface Fabric.

Un message toast montre que Fabric prépare votre terminau pour servir des prédictions, et que le statut du terminau change en Activating. En coulisses, Fabric lance l’infrastructure conteneur sous-jacente pour héberger votre modèle. Dans quelques minutes, votre point de terminaison est prêt à servir des prédictions.

Capture d’écran montrant un point de terminaison de modèle ML qui est désormais activé.

Chaque point de terminaison a un statut indiquant s’il est prêt à servir des prédictions en temps réel :

État Description
Inactive Le point de terminaison n'est pas activé pour fournir des prédictions en temps réel, et il ne consomme pas la capacité Fabric.
Activating Le point de terminaison est configuré pour traiter les prédictions en temps réel. En arrière-plan, Fabric configure l’infrastructure conteneur sous-jacente pour héberger le modèle. Dans quelques minutes, le point de terminaison est actif.
Active Le point de terminaison est prêt à fournir des prédictions en temps réel. En arrière-plan, Fabric gère l’infrastructure sous-jacente, mettant à l’échelle l’utilisation des ressources en fonction du trafic entrant. Un trafic plus élevé entraîne une utilisation plus élevée de la capacité de Fabric.
Deactivating Le point de terminaison est en cours de désactivation, de sorte qu’il ne fournit plus de prédictions en temps réel et ne consomme plus de capacité Fabric. En coulisses, Fabric démantèle l'infrastructure des conteneurs sous-jacente.

Remarque

Les modèles ML peuvent prendre en charge les points de terminaison actifs pour jusqu’à cinq versions à la fois. Pour traiter les prédictions à partir d’une sixième version, vous devez d’abord désactiver un point de terminaison actif.

Gérer les points de terminaison de modèle

Pour avoir un aperçu des points de terminaison actifs de votre modèle, sélectionnez Gérer les points de terminaison depuis le ruban de l’interface. Chaque modèle a un point de terminaison par défaut personnalisable, qui sert les prédictions d’une version que vous choisissez. Vous pouvez mettre à jour la version par défaut en utilisant le sélecteur déroulant dans le panneau des paramètres.

Capture d’écran montrant l’URL de point de terminaison de modèle ML par défaut, que vous pouvez configurer pour traiter les prédictions à partir d’une version spécifique.

Important

Définissez la propriété par défaut sur une version active si vous comptez l’utiliser. Si vous ne définissez pas la propriété par défaut, ou si vous la mettez en version inactive, les appels vers le point d’extrémité par défaut échouent.

Les paramètres du point de terminaison du modèle répertorient toutes les versions avec des points de terminaison actifs. Vous pouvez modifier la propriété de veille automatique de chaque point de terminaison en basculant le commutateur sur On ou Off.

Capture d’écran montrant comment modifier la propriété de veille automatique sur les points de terminaison du modèle ML.

Conseil / Astuce

Les terminaux actifs avec la veille automatique activée entrent en état d’inactivité après cinq minutes sans trafic. Le premier appel pour les réveiller implique un court délai. Vous pourriez vouloir désactiver cette propriété pour les terminaux en production.

Points de terminaison de modèle de requête pour les prédictions en temps réel

Vous pouvez tester instantanément les points de terminaison des modèles en utilisant l’expérience low-code dans Fabric. Accédez à une version avec un point de terminaison actif et sélectionnez Prévisualiser les prédictions dans le ruban de l’interface. Vous pouvez envoyer des requêtes d’échantillons au point de terminaison et obtenir des prédictions d’échantillons en temps réel en utilisant des champs de formulaire correspondant à la signature d’entrée du modèle.

Capture d’écran montrant l’expérience en préversion intégrée pour obtenir des exemples de prédictions à partir d’un point de terminaison de modèle ML actif.

Sélectionnez Remplissage automatique pour remplir les champs du formulaire avec des valeurs d’échantillons aléatoires. Vous pouvez ajouter d’autres ensembles de valeurs de formulaire pour tester le point de terminaison avec plusieurs entrées. Sélectionnez Obtenir des prédictions pour envoyer votre demande d’exemple au point de terminaison.

Capture d’écran montrant la vue basée sur le formulaire pour l’envoi d’exemples de requêtes à un point de terminaison de modèle ML actif.

Si vous préférez mettre en forme des exemples de requêtes en tant que charges utiles JSON, utilisez le sélecteur de liste déroulante pour modifier la vue.

Capture d’écran montrant la vue JSON pour l’envoi d’exemples de requêtes à un point de terminaison de modèle ML actif.

Désactiver les points de terminaison de modèle

Vous pouvez désactiver des points de terminaison de modèle directement à partir de l’interface Fabric. Allez dans une version où vous n’avez plus besoin de servir les prédictions en temps réel et sélectionnez Désactiver le point de terminaison de version depuis le ruban de l’interface.

Screenshot montrant comment désactiver un point de terminaison de modèle ML à partir de l’interface Fabric interface.

Une notification toast indique que Fabric supprime votre déploiement actif, et l’état du point de terminaison passe à Deactivating. Le point de terminaison ne peut pas fournir de prédictions en temps réel à moins que vous ne le réactivez.

Capture d’écran montrant un point de terminaison de modèle ML qui est désormais désactivé.

Vous pouvez désactiver des points de terminaison pour plusieurs versions à la fois à partir du volet paramètres du modèle. Sélectionnez Gérer les points de terminaison depuis le ruban de l’interface et choisissez un ou plusieurs points de terminaison actifs à désactiver.

Screenshot montrant comment désactiver plusieurs points de terminaison de modèle ML à la fois à partir de l’interface Fabric.

Taux de consommation

L’hébergement de points de terminaison de modèles actifs consomme des unités de capacité de Fabric (UC). Les points de terminaison s’exécutent sur des nœuds de calcul et peuvent augmenter automatiquement en capacité jusqu'à trois nœuds en fonction du trafic entrant. La facturation est calculée par nœud pendant qu’un point de terminaison est actif. Le tableau suivant indique la consommation de CU pour un point de terminaison actif d’un modèle ML.

Fonctionnement Unité de mesure d’opération taux de consommation
Point de terminaison du modèle 1 point de terminaison de modèle (version) par seconde et par node 5 secondes CU

Le tableau suivant présente des exemples de scénarios ainsi que leurs taux de consommation et coûts horaires correspondants.

Scénario Description taux de consommation Coût horaire
Modèles avec des points de terminaison inactifs Ces modèles n’ont aucun point de terminaison de version actif et aucune utilisation des ressources associée. Ils n’impliquent aucun coût supplémentaire. 0 CU secondes 0 heure(s) CU
Modèles avec des points de terminaison actifs mais inactifs Ces modèles disposent d’une ou plusieurs versions actives de terminaisons, mais, sans trafic régulier, tous les terminaux évoluent vers zéro, réduisant automatiquement les coûts. 5 secondes CU 0,42 heures CU
Modèles avec un point de terminaison actif et un trafic faible constant Ces modèles n’ont qu’un point de terminaison de la version actif servant des prédictions, mais sans suffisamment de trafic pour déclencher une extension horizontale complète. Un seul nœud peut servir tout le trafic. Les autres points de terminaison de version peuvent être inactifs ou au repos. 5 secondes CU 5 HEURES CU
Modèles avec un point de terminaison actif et un trafic élevé constant Ces modèles n’ont qu’un seul point de terminaison de version actif qui fournit des prédictions, avec suffisamment de trafic pour déclencher une montée en charge complète. Les autres points de terminaison de version peuvent être inactifs ou au repos. 15 CU-secondes 15 HEURES CU
Modèles avec 5 points de terminaison actifs et trafic élevé constant Ces modèles ont 5 points de terminaison de version actifs (la limite actuelle) servant des prédictions, avec suffisamment de trafic sur chacun pour déclencher une mise à l'échelle complète. 75 CU secondes 75 heures CU

L’application Métriques de capacité Fabric affiche l’utilisation totale de la capacité pour les opérations de point de terminaison de modèle sous le nom « Point de terminaison de modèle ». De plus, les utilisateurs peuvent consulter un résumé de leurs frais de facturation pour l’utilisation de Model Endpoint sous l’élément de facturation « ML Model Model Endpoint Capacity Usage CU ».

L'opération du point de terminaison du modèle est classée comme opération en arrière-plan.

Les taux de consommation sont susceptibles de changer à tout moment. Microsoft utilise des efforts raisonnables pour fournir un avis par e-mail ou par le biais d’une notification in-product. Les modifications sont en vigueur à la date indiquée dans les notes de version Microsoft ou le blog Microsoft Fabric. Si une modification apportée au point de terminaison du modèle dans le taux de consommation de Fabric augmente de manière significative les unités de capacité (UC) requises pour l'utilisation, les clients peuvent utiliser les options d'annulation disponibles pour le mode de paiement qu'ils ont choisi.