Taux de consommation et facturation pour Copilot dans Fabric

Copilot La consommation est le modèle de facturation qui mesure la quantité de Fabric Capacity Units (CU) utilisée par les requêtes Copilot. Chaque Copilot interaction est mesurée par le nombre de jetons traités : environ 1 000 jetons sont 750 mots. Les jetons d’entrée et de sortie sont consommés à différents taux et les prix sont calculés par 1 000 jetons.

Copilot taux de consommation par jeton

Les requêtes adressées à Copilot dans Fabric consomment des unités de capacité Fabric (UC). Le tableau suivant indique combien de CU sont consommées par 1 000 tokens pour les prompts d’entrée et les complétions de sortie. Ces tarifs s’appliquent à toutes les Copilot expériences, notamment Copilot pour Power BI, Copilot pour Data Factory et Copilot pour l’ingénierie des données et la science des données. Copilot et les fonctionnalités d’IA utilisent la mise en cache par prompts pour réduire la consommation de jetons d’entrée réutilisés entre requêtes. Lorsqu’une requête partage un préfixe commun avec une requête précédente récente, telle que des instructions système, le contexte du schéma ou l’historique des conversations, la portion qui se chevauche est servie depuis le cache à un taux réduit tel que posté. Le système applique automatiquement la mise en cache des prompts et ne nécessite aucune configuration.

Opération dans l’application Metrics Description Unité de mesure d'opération Taux de consommation
Copilot dans Fabric Invite d’entrée Par 1 000 jetons 100 CU secondes
Copilot dans Fabric L’invite d’entrée mise en cache Par 1 000 jetons 10 secondes CU
Copilot dans Fabric Achèvement des résultats Par 1 000 jetons 400 CU secondes

Surveiller l’utilisation de Copilot

L’application Métriques de capacité Fabric affiche l’utilisation totale de la capacité pour les opérations Copilot sous le nom de l’opération Copilot dans Fabric. Copilotles utilisateurs peuvent également afficher un résumé de leurs frais de facturation sous l’élément Copilot de facturation dans Fabric.

Capture d’écran de l’application Métriques de capacité Fabric illustrant Copilot dans l’usage de Fabric.

Envisagez une approche progressive pour l’adoption de Copilot. Avant de déployer des fonctionnalités basées sur l’IA, telles que le déploiement de résumés d’abonnements sur des centaines d’utilisateurs ou l’incorporation d’visuels de narration IA sur des tableaux de bord à trafic élevé, activez-les pour un petit groupe pilote en premier. Utilisez l’application Métriques de capacité Fabric pour mesurer la consommation pour chaque scénario, puis extrapolez avant de mettre à l’échelle. Le déploiement à grande échelle sans valider les modèles de consommation peut rapidement épuiser votre capacité.

Classification et régulation des tâches en arrière-plan

Copilotles opérations dans Fabric sont classées en tant que travaux en arrière-plan, ce qui permet Fabric de gérer un volume plus élevé de Copilot requêtes pendant les heures de pointe.

Fabric permet aux opérations d’accéder à davantage de ressources CU que celles allouées à une capacité. Fabric lisse la consommation de CU d’une tâche interactive sur une durée minimale de 5 minutes et celle d’une tâche en arrière-plan sur une période de 24 heures. Selon la politique de limitation de Fabric, la première phase de limitation commence lorsqu’une capacité a consommé toutes ses ressources CU disponibles pour les 10 minutes suivantes.

Par exemple, supposons que chaque demande de Copilot a 2 000 jetons d’entrée et 500 jetons de sortie. Le prix d’une Copilot requête est calculé comme suit : (2 000 × 100 + 500 × 400) / 1 000 = 400,00 CU secondes = 6,67 CU minutes.

Étant donné que les opérations dans Fabric Copilot sont des tâches d’arrière-plan, chaque requête (tâche d’environ 6,67 minutes de CU) ne consomme qu’une minute de CU sur chaque heure de capacité. Par exemple, un client disposant d’un SKU F64 a 64 × 24 = 1 536 heures d’UC par jour. Chaque Copilot demande consomme 6,67 / 60 = 0,11 CU heures, afin que les clients puissent exécuter plus de 13 824 Copilot requêtes par jour avant d’épuiser la capacité. Une fois la capacité épuisée, toutes les opérations s’arrêtent.

Traitement des données interrégional pour Copilot dans Fabric

Copilot dans Fabric s’appuie sur les grands modèles de langage d’Azure OpenAI déployés dans un nombre limité de centres de données. Les clients peuvent activer le traitement intergéographique dans les paramètres du locataire pour Copilot traiter les données dans une autre région où Azure OpenAI Service est disponible. Cette région peut être en dehors de la région géographique de l’utilisateur, de la limite de conformité ou de l’instance de cloud national. Le mappage de région hiérarchise la résidence des données et tente de mapper à une région au sein de la même zone géographique chaque fois que cela est possible.

Le coût des unités de capacité de Fabric peut varier selon la région. Quelle que soit la région de consommation où la capacité GPU est utilisée, les clients sont facturés en fonction de la tarification de l’unité de capacité dans leur région de facturation. Par exemple, si les demandes d’un client sont mappées ( region 1région de facturation) à region 2(région de consommation), le client est facturé en fonction de la tarification dans region 1 (la région de facturation).

Modifications du taux de consommation de tissu pour le Copilot

Les taux de consommation sont susceptibles de changer à tout moment. Microsoft utilise des efforts raisonnables pour fournir une notification par e-mail ou par le biais d’une notification dans le produit. Les modifications sont effectives à la date indiquée dans les notes de publication de Microsoft ou le blog Microsoft Fabric. Si une modification des taux de Copilot consommation dans Fabric augmente matériellement les unités de capacité (CU) nécessaires à l’utilisation Copilot dans Fabric, les clients peuvent utiliser les options d’annulation disponibles pour le mode de paiement choisi.