Qu’est-ce que Foundry Local sur Azure Local ?

Foundry Local sur Azure Local apporte l’inférence IA à votre environnement Azure Local. Déployez et exécutez des modèles IA sur un cluster Kubernetes activé par Arc avec des opérations natives Kubernetes. Conservez votre traitement des données localement où vos données sont générées.

Ce modèle de déploiement est conçu pour les organisations qui ont besoin d’un contrôle local, d’une inférence à faible latence et d’une intégration avec les opérations Kubernetes existantes sur Azure Local.

Foundry Local on Azure Local est l’une des deux options permettant d’exécuter des modèles IA localement. Il est conçu pour les organisations qui ont besoin d’une inférence à l’échelle de l’entreprise sur une infrastructure locale, avec des opérations natives Kubernetes et une gestion Azure Arc. Si vous souhaitez incorporer l’IA dans une application cliente qui s’exécute sur du matériel de l’utilisateur final, consultez Foundry Local. Avec cette option, les données restent sur l'appareil, l'application peut fonctionner hors connexion et vous n'avez pas besoin d'un abonnement Azure.

Important

  • Foundry Local est disponible en préversion. Les préversions fournissent un accès anticipé aux fonctionnalités qui sont en cours de déploiement actif.
  • Les fonctionnalités, les approches et les processus peuvent changer ou avoir des fonctionnalités limitées avant la disponibilité générale.

Demander l’accès au déploiement

Foundry Local sur le déploiement local d'Azure est actuellement disponible sur demande pendant la version d’évaluation. Pour commencer, envoyez le formulaire de demande d’accès : demander l’accès au déploiement en préversion.

Fonctionnalités clés

Les fonctionnalités suivantes mettent en évidence ce que vous pouvez faire avec Foundry Local sur Azure Local.

  • Exécutez des charges de travail d’inférence IA sur Azure Local avec des opérations natives Kubernetes.
  • Déployez et gérez des modèles par le biais de ressources personnalisées plutôt que de câblage manuel de service.
  • Utilisez des modèles REST compatibles OpenAI pour l’intégration d’applications.
  • Prendre en charge les déploiements soutenus par PROCESSEUR et GPU en fonction de la charge de travail et du profil matériel.
  • Mettre à l’échelle l’inférence sur des clusters Kubernetes multinœuds pour une utilisation concurrente et la prise en charge de modèles à grand nombre de paramètres.
  • Fonctionnez dans des environnements déconnectés où la connectivité Internet n’est pas disponible, avec un modèle de déploiement cohérent avec les scénarios connectés.
  • Sécuriser l’accès au point de terminaison à l’aide de clés API, d’authentification Microsoft Entra ID et de modèles d’API de passerelle compatibles TLS.
  • Synchronisez les métadonnées du catalogue de modèles afin que les équipes puissent découvrir et déployer des modèles pris en charge de manière cohérente.

Résumé de l’architecture

Foundry Local sur Azure Local s’exécute sur un cluster Kubernetes avec Arc et est déployé en tant qu’extension Azure Arc. Il utilise un plan de contrôle basé sur un opérateur pour la gestion du cycle de vie des modèles. À un niveau élevé :

  • L’opérateur d’inférence Kubernetes surveille l’état du cluster et rapproche les ressources du modèle.
  • Une ressource de modèle définit les métadonnées du modèle. Les modèles peuvent provenir du catalogue de la fonderie ou de votre propre registre.
  • Une ressource ModelDeployment définit l’intention d’exécution, telle que la mise à l’échelle du profil et l’exposition des points de terminaison.
  • La plateforme peut synchroniser les métadonnées du catalogue de modèles dans le cluster pour la cohérence des versions et de la détectabilité.
  • Le trafic d’inférence est exposé via des services internes ou l’API Gateway de Kubernetes, et protégé par une clé API, la validation des jetons Entra ID, ainsi que par l’authentification et TLS.

Le diagramme suivant montre comment ces composants fonctionnent ensemble. Un cluster Kubernetes activé par Arc exécute l'extension "Foundry Local" et l'opérateur d'inférence, qui gèrent les ressources de modèle et de déploiement de modèle. Les applications appellent des points de terminaison d’inférence sécurisés via l’API de passerelle à l’aide de clés API ou de jetons Entra ID.

Diagramme de Foundry Local sur l'architecture Azure Local avec extension gérée par Arc, opérateur d'inférence et ressources de modèle, ainsi que des appels d'applications aux points de terminaison d'inférence sécurisés.

Pour le contexte de la plateforme Azure, consultez Azure Arc activé pour Kubernetes et Qu'est-ce qu'Azure Local ?.

Pour connaître les différences d’architecture dans les déploiements déconnectés, consultez l’architecture de l’environnement déconnectée.

Fonctionnement

Foundry Local on Azure Local est installé en tant qu’extension Azure Arc et inclut les composants principaux suivants :

  • opérateur Inference : opérateur Kubernetes que Foundry Local sur Azure Local utilise pour installer et gérer les composants d’inférence et rapprocher les changements de cycle de vie du modèle.
  • CRD Model et ModelDeployment : ressources déclaratives qui définissent les modèles disponibles et les déploiements de service actifs.
  • Synchronisation du catalogue : apporte des métadonnées de catalogue de modèles dans le cluster afin de pouvoir sélectionner et déployer des modèles pris en charge de manière cohérente.
  • Authentification par clé API : protège les points de terminaison d'inférence en exigeant des clés API de type jeton porteur pour les demandes.
  • Authentification Entra ID : valide les jetons web JSON d’Azure Active Directory via le moteur d'accompagnement Microsoft pour le contrôle d’accès basé sur l’identité et offre une alternative aux clés API.
  • API TLS et passerelle : sécurise le trafic en transit et active l’accès externe contrôlé via l’API de passerelle.

Pour les opérations en mode déconnecté, consultez Foundry Local on Azure Local in disconnected environments overview pour connaître les composants et le comportement qui diffèrent des déploiements connectés.

Utilisez Foundry Local activé par Azure Arc via des API REST ou directement via des ressources Kubernetes. Pour plus d’informations, consultez points de terminaison et charge utile de l’API d’inférence.

Étendue des conditions préalables

Pour utiliser Foundry Local sur Azure Local, planifiez ces prérequis à un niveau élevé :

  • Azure Local environnement avec une capacité de cluster Kubernetes dimensionnée pour vos modèles cibles.
  • Connexion Arc pour la gestion de Kubernetes et les opérations du cycle de vie basées sur des extensions.
  • Profil de calcul approprié (nœuds avec PROCESSEUR uniquement ou GPU) et pilotes et plug-ins validés pour les scénarios GPU.
  • Accès opérationnel Kubernetes et autorisations au niveau du cluster pour installer l’extension Azure Arc et gérer les ressources personnalisées.
  • Posture de réseau et de sécurité pour la gestion des api de passerelle, la gestion des certificats et la gestion des clés API.

Pour les environnements déconnectés, utilisez les prérequis dédiés et les instructions de configuration dans Plan pour déployer Foundry Local sur Azure Local dans des environnements déconnectés et Deploy Foundry Local en tant qu’extension Azure Arc dans un environnement déconnecté.

Régions prises en charge

Foundry Local est disponible en tant qu’extension Azure Arc dans les régions suivantes :

  • Australia East
  • Canada Central
  • Central India
  • Central US
  • EUAP USA Centre
  • East US
  • Est des États-Unis 2
  • Est des États-Unis 2 EUAP
  • Japan East
  • Korea Central
  • North Europe
  • États-Unis – partie centrale méridionale
  • Southeast Asia
  • UK South
  • West Europe
  • West US
  • Ouest des États-Unis 2
  • Ouest des États-Unis 3

Charges de travail prises en charge

Foundry Local on Azure Local prend en charge les charges de travail d’inférence IA telles que :

  • Inférence IA générative: scénarios de génération de texte et de style conversationnel via des modèles de requête compatibles OpenAI, à l’aide du moteur ONNX-GenAI par défaut (processeur ou GPU) ou du moteur vLLM (GPU uniquement) pour les scénarios à haut débit.
  • Inférence d’IA prédictive : modèle non génératif servant à la classification, au scoring ou à d’autres tâches de prédiction déterministes.
  • Exécution du processeur et du GPU : objectifs de déploiement flexibles en fonction des performances et des exigences de coût.
  • Modèles de service multimodèle : plusieurs déploiements de modèles gérés de manière déclarative au sein du même cluster.

Quand utiliser

Utilisez Foundry Local sur Azure Local lorsque vous devez :

  • Conservez l’inférence et le traitement des données localement pour la souveraineté ou les exigences réglementaires.
  • Réduisez la latence des allers-retours en servant des modèles proches des applications et des sources de données.
  • Normaliser le service IA avec des opérations natives Kubernetes dans les flux de travail existants de la plateforme.
  • Utilisez des modèles de gestion connectés Azure lors de l’exécution de l’inférence sur l’infrastructure locale.
  • Mettre à l’échelle l’inférence IA sur plusieurs nœuds dans un cluster Kubernetes pour un accès simultané et des modèles plus volumineux.
  • Exécutez l’inférence IA dans des environnements déconnectés ou isolés physiquement, sans connexion Internet.