Recommandations de mise en réseau de Lakehouse Federation

Cet article fournit des conseils pour la configuration d’un chemin d’accès réseau viable entre vos clusters Azure Databricks ou vos entrepôts SQL et le système de base de données externe auquel vous vous connectez en utilisant Lakehouse Federation.

Tenez compte des éléments suivants lorsque vous configurez la connectivité réseau pour la fédération Lakehouse :

  • Tout le trafic réseau pour les requêtes fédérées est directement entre les clusters Azure Databricks (ou les entrepôts SQL) et le système de base de données externe. Ni le catalogue Unity ni le plan de contrôle Azure Databricks ne se trouve sur le chemin d’accès réseau.
  • Les connexions qui utilisent OAuth ont une exigence supplémentaire. Lorsqu’une connexion s’authentifie avec OAuth, l’échange de jetons OAuth se produit à partir du plan de contrôle Azure Databricks, et non du plan de calcul. Le plan de contrôle doit être en mesure d’atteindre le point de terminaison OAuth du système externe. La simple mise en liste d’autorisation du plan de calcul n’est pas suffisante pour ces connexions. Pour obtenir des conseils spécifiques au connecteur, consultez la section mise en réseau ou limitations de la page de connexion appropriée, par exemple Exécuter des requêtes fédérées sur Snowflake (OAuth) ou Exécuter des requêtes fédérées sur Microsoft SQL Server. Les connexions HTTP sont une exception ; ils routent OAuth via le plan de calcul serverless plutôt que le plan de contrôle.
  • Le calcul Azure Databricks (c’est-à-dire les clusters et les entrepôts SQL) se déploie toujours dans le cloud, mais le système de base de données externe peut être local ou hébergé sur n’importe quel fournisseur de cloud, tant qu’il existe un chemin réseau viable entre votre calcul Azure Databricks et la base de données externe.
  • Si vous avez des restrictions réseau entrantes ou sortantes sur le calcul Azure Databricks ou le système de base de données externe, reportez-vous aux sections suivantes pour obtenir des conseils généraux afin de vous aider à créer un chemin d’accès réseau viable.

Pour plus d’informations sur la mise en réseau dans les espaces de travail Azure Databricks, consultez Mise en réseau.

Système de base de données et calcul Azure Databricks accessibles à partir d’Internet

La connexion doit fonctionner sans aucune configuration.

Le système de base de données a des restrictions d’accès réseau

Si le système de base de données externe a des restrictions d’accès réseau entrantes ou sortantes et que le cluster Azure Databricks ou SQL Warehouse est accessible à partir d’Internet, configurez l’une des solutions réseau suivantes pour vous connecter à partir de ressources de calcul classiques :

  • Adresse IP de sortie stable sur une capacité de calcul Azure Databricks.

    À partir du plan de calcul classique, configurez une adresse IP stable avec un équilibreur de charge, une passerelle NAT, une passerelle Internet ou un équivalent, et connectez-la au sous-réseau où un calcul Azure Databricks est déployé. Cela permet à la ressource de calcul d’utiliser une adresse IP publique stable qui peut être ajoutée à une liste d’autorisation du côté de la base de données externe.

  • Private Link (uniquement lorsque la base de données externe se trouve sur le même cloud que le calcul Azure Databricks)

    À partir du plan de calcul classique, configurez une connexion Private Link entre le réseau où la base de données est déployée et le réseau où le calcul Azure Databricks est déployé.

Depuis le plan de calcul serverless, Azure Private Link est pris en charge pour le connecteur SQL Server. Consultez Créer des règles de point de terminaison privé.

Le calcul Azure Databricks a des restrictions d’accès réseau

Si le système de base de données externe est accessible à partir d’Internet et que le calcul Azure Databricks a des restrictions d’accès au réseau entrant ou sortant (ce qui n’est possible que si vous êtes sur un réseau géré par le client), effectuez l’une des configurations suivantes :

  • Ajoutez le nom d’hôte de la base de données externe à la liste d’autorisation dans les règles de pare-feu du sous-réseau où le calcul Azure Databricks est déployé.

    Si vous choisissez d’autoriser l’adresse IP de la base de données externe plutôt que le nom d’hôte, vérifiez que la base de données externe a une adresse IP stable.

  • Private Link (uniquement lorsque la base de données externe est sur le même cloud que les ressources de calcul Azure Databricks)

    Configurez une connexion Private Link entre le réseau où la base de données est déployée et le réseau où le calcul Azure Databricks est déployé.

Le calcul Azure Databricks a un serveur DNS personnalisé

Si le système de base de données externe est accessible à partir d’Internet et que le calcul Azure Databricks dispose d’un serveur DNS personnalisé (ce qui n’est possible que si vous êtes sur un réseau géré par le client), ajoutez le nom d’hôte du système de base de données à votre serveur DNS personnalisé afin qu’il puisse être résolu.

Considérations relatives au réseau Snowflake

  • Si Azure Databricks calcul ne peut pas atteindre le répondeur OCSP Snowflake, les tentatives de connexion peuvent échouer pendant la validation du certificat. Préférez autoriser le trafic sortant vers le répondeur OCSP Snowflake. Si votre configuration de connectivité privée ou à sortie restreinte ne peut pas autoriser ce trafic, définissez l’option de connexion Snowflake disableOCSPChecks sur true. Consultez les options de connexion avancées.