Connecteur d’ingestion Microsoft SQL Server

Cette page vous aide à comprendre le flux de travail d’ingestion SQL Server, y compris les facteurs qui déterminent votre approche de configuration et les étapes impliquées pour différents personnages utilisateur.

CDC standard vs. CDC intégré

SQL Server prend en charge deux architectures d’ingestion. Le tableau suivant les compare :

Fonctionnalité CDC standard (basé sur une passerelle) CDC intégré (bêta)
Nombre de pipelines Deux (passerelle d’ingestion et pipeline d’ingestion) Un (pipeline unifié)
Configuration Créez une passerelle, puis créez un pipeline d’ingestion qui référence l’ID de passerelle Créer un pipeline unique qui fait référence à une connexion de catalogue Unity
Mode passerelle La passerelle s’exécute en continu Le pipeline intègre l’extraction dans chaque mise à jour
Référence de connexion ingestion_gateway_id connection_name (une connexion Unity Catalog)
Type de connecteur Implicite Explicite : connector_type: CDC
Volume intermédiaire La passerelle gère le volume de transit en interne Vous configurez le volume intermédiaire via data_staging_options. Le pipeline en crée automatiquement un si aucun n’est spécifié.

La même configuration de base de données source s’applique aux deux architectures. Consultez Configurer Microsoft SQL Server pour l’ingestion dans Azure Databricks. Pour plus d’informations, consultez Créer un pipeline CDC intégré pour SQL Server.

Disponibilité des fonctionnalités

Fonctionnalité Availability
Création de pipelines basés sur l’interface utilisateur Icône de coche verte Soutenu
Création de pipelines basés sur l’API Icône de coche verte Soutenu
Paquets d'Automatisation déclarative Icône de coche verte Soutenu
Ingestion progressive Icône de coche verte Soutenu
Gouvernance du catalogue Unity Icône de coche verte Soutenu
Orchestration avec Lakeflow Jobs Icône de coche verte Soutenu
Type SCD 2 Icône de coche verte Soutenu
Sélection et désélection des colonnes basées sur l’API Icône de coche verte Soutenu
Filtrage de lignes basé sur l’API Icône X rouge Non pris en charge
Évolution du schéma automatisé : colonnes nouvelles et supprimées Icône de coche verte Soutenu
Évolution automatisée du schéma : modifications du type de données Icône X rouge Non pris en charge
Évolution du schéma automatisé : renommage des colonnes Icône X rouge Non pris en charge
Nécessite une actualisation complète.
Évolution automatisée du schéma : nouvelles tables Icône de coche verte Soutenu
Si vous ingérez l’intégralité du schéma. Consultez les limitations relatives au nombre de tables par pipeline.
Nombre maximal de tables par pipeline 250

Méthodes d’authentification

Méthode d’authentification Availability
OAuth U2M Icône X rouge Non pris en charge
OAuth M2M Icône X rouge Non pris en charge
OAuth (jeton d’actualisation manuel) Icône X rouge Non pris en charge
Authentification de base (nom d’utilisateur/mot de passe) Icône de coche verte Soutenu
Authentification de base (clé API) Icône X rouge Non pris en charge
Authentification de base (clé JSON du compte de service) Icône X rouge Non pris en charge

Que savoir avant de commencer

Sujet Pourquoi cela se produit-il
Persona utilisateur Azure Databricks Le flux de travail dépend de votre persona utilisateur Azure Databricks :
  • Utilisateur unique : un utilisateur administrateur configure la base de données source et crée une connexion de catalogue Unity, une passerelle d’ingestion et un pipeline d’ingestion.
  • Multi-utilisateur : un utilisateur administrateur configure la base de données source et crée une connexion pour les utilisateurs non administrateurs afin de créer des paires de pipelines de passerelle avec.
Variante de base de données La configuration de la base de données source dépend de l’environnement de déploiement SQL Server.
Méthode de suivi des modifications La configuration de la base de données source dépend de la façon dont vous choisissez de suivre les modifications dans la source.
Méthode d’authentification Les étapes de création d’une connexion dépendent de la méthode d’authentification que vous choisissez.
Interface Les étapes de création d’une connexion, d’une passerelle et d’un pipeline dépendent de l’interface.
Fréquence d’ingestion La planification du pipeline dépend de vos besoins en matière de latence et de coût.
Modèles courants Selon vos besoins d’ingestion, le pipeline peut utiliser des configurations telles que le suivi de l’historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Consultez Disponibilité des fonctionnalités.

Démarrer l’ingestion à partir de SQL Server

Le tableau suivant fournit une vue d’ensemble du flux de travail d’ingestion SQL Server de bout en bout, en fonction du type d’utilisateur :

Utilisateur Étapes
Admin
Non administrateur Utilisez n’importe quelle interface prise en charge pour créer une passerelle et un pipeline. Consultez Ingestion des données à partir de SQL Server.