Connectar-se a taules del Common Data Model a l'Azure Data Lake Storage

Nota

L'Azure Active Directory ara és Microsoft Entra ID. Aprèn més

Ingerir dades al Dynamics 365 Customer Insights: dades mitjançant el compte de l'Azure Data Lake Storage amb taules del Common Data Model. La ingesta de dades pot ser completa o incremental.

Requisits previs

  • El compte de l'Azure Data Lake Storage ha de tenir habilitat l'espai de noms jeràrquic. Les dades s'han d'emmagatzemar en un format de carpeta jeràrquica que defineixi la carpeta arrel i tingui subcarpetes per a cada taula. Les subcarpetes poden tenir carpetes de dades completes o de dades incrementals.

  • Per autenticar-se amb una entitat de servei del Microsoft Entra, s'ha de configurar a l'inquilí. Per obtenir més informació, vegeu Connectar-se a un compte de l'Azure Data Lake Storage amb una entitat de servei del Microsoft Entra.

  • Per connectar-vos a l'emmagatzematge protegit per tallafocs, configureu els enllaços privats de l'Azure.

  • Si el llac de dades té connexions d'enllaç privat, el Customer Insights - Les dades també s'han de connectar mitjançant un enllaç privat, independentment de la configuració d'accés a la xarxa.

  • L'Azure Data Lake Storage des del qual voleu connectar-vos i ingerir dades ha d'estar a la mateixa regió de l'Azure que l'entorn del Dynamics 365 Customer Insights i les subscripcions han d'estar al mateix inquilí. No s'admeten connexions a una carpeta Common Data Model des d'un llac de dades d'una altra regió de l'Azure. Per conèixer la regió Azure de l'entorn, aneu a Configuració>del sistema>Quant a a Customer Insights - Dades.

  • Les dades emmagatzemades en serveis en línia poden emmagatzemar-se en una ubicació diferent d'on es processen o emmagatzemen les dades. En importar o connectar-se a dades emmagatzemades en serveis en línia, accepteu que es puguin transferir dades. Obteniu més informació al Centre de confiança de Microsoft.

  • L'entitat principal del servei Customer Insights - Data ha d'estar en una de les funcions següents per accedir al compte d'emmagatzematge. Per obtenir més informació, vegeu Concedir permisos a l'entitat de servei per accedir al compte d'emmagatzematge.

    • Lector de dades de blobs d'emmagatzematge
    • Propietari de dades de blob d'emmagatzematge
    • Col·laborador de dades blob d'emmagatzematge
  • Quan es connecta a l'emmagatzematge de l'Azure mitjançant l'opció de subscripció de l'Azure , l'usuari que configura la connexió de la font de dades necessita com a mínim els permisos de col·laborador de dades blob d'emmagatzematge al compte d'emmagatzematge.

  • Quan es connecta a l'emmagatzematge de l'Azure mitjançant l'opció de recurs de l'Azure , l'usuari que configura la connexió de la font de dades necessita almenys el permís per a l'acció Microsoft.Storage/storageAccounts/read al compte d'emmagatzematge. Una funció integrada de l'Azure que inclou aquesta acció és la funció de lector . Per limitar l'accés només a l'acció necessària, creeu una funció personalitzada de l'Azure que inclogui només aquesta acció.

  • Per obtenir un rendiment òptim, la mida d'una partició ha de ser d'1 GB o menys i el nombre de fitxers de partició d'una carpeta no ha de superar els 1000.

  • Les dades del Data Lake Storage han de seguir l'estàndard Common Data Model per a l'emmagatzematge de les dades i tenir el manifest Common Data Model per representar l'esquema dels fitxers de dades (*.csv o *.parquet). El manifest ha de proporcionar els detalls de les taules, com ara les columnes i els tipus de dades de la taula, i la ubicació i el tipus de fitxer del fitxer de dades. Per obtenir més informació, vegeu Manifest del Common Data Model. Si el manifest no està present, els usuaris administradors amb accés de propietari de dades blob d'emmagatzematge o col·laborador de dades blob d'emmagatzematge poden definir l'esquema en ingerir les dades.

    Nota

    Si algun dels camps dels fitxers .parquet té el tipus de dades Int96, és possible que les dades no es mostrin a la pàgina Taules . Recomanem utilitzar tipus de dades estàndard, com el format de marca de temps Unix (que representa l'hora com el nombre de segons des de l'1 de gener de 1970, a mitjanit UTC).

Limitacions

  • Customer Insights: les dades no admeten columnes de tipus decimal amb una precisió superior a 16.

Connectar-se a l'Azure Data Lake Storage

Els noms de connexió de dades, els camins de dades com ara les carpetes d'un contenidor i els noms de taula han d'utilitzar noms que comencin per una lletra. Els noms només poden contenir lletres, números i guions baixos (_). No s'admeten caràcters especials.

  1. Aneu aFonts de dades de >.

  2. Seleccioneu Afegeix una font de dades.

  3. Seleccioneu Taules del model de dades comús de l'Azure Data Lake. Quadre de diàleg per introduir els detalls de connexió de l'Azure Data Lake amb taules del Common Data Model.

  4. Introduïu un nom de font de dades i una descripció opcional. Es fa referència al nom en processos posteriors i no és possible canviar-lo després de crear la font de dades.

  5. Trieu una de les opcions següents per connectar el vostre emmagatzematge usant. Per obtenir més informació, vegeu Connectar-se a un compte de l'Azure Data Lake Storage amb una entitat de servei del Microsoft Entra.

    • Recurs Azure: introduïu l'identificador de recurs.
    • Subscripció de l'Azure: seleccioneu la subscripció i, a continuació, el grup de recursos i el compte d'emmagatzematge.

    Nota

    Necessiteu una de les funcions següents al contenidor per crear la font de dades:

    • El lector de dades de blobs d'emmagatzematge és suficient per llegir des d'un compte d'emmagatzematge i ingerir les dades a Customer Insights - Dades.
    • El col·laborador o propietari de dades blob d'emmagatzematge és necessari si voleu editar els fitxers de manifest directament a Customer Insights - Dades.

    Tenir la funció al compte d'emmagatzematge proporciona la mateixa funció a tots els seus contenidors.

  6. Trieu el nom del contenidor que conté les dades i l'esquema (model.json o manifest.json fitxer) des del qual voleu importar dades.

    Nota

    Cap model.json o manifest.json fitxer associat a una altra font de dades de l'entorn no es mostra a la llista. Tanmateix, el mateix fitxer model.json o manifest.json es pot utilitzar per a fonts de dades en diversos entorns.

  7. Opcionalment, si voleu ingerir dades d'un compte d'emmagatzematge a través d'un enllaç privat de l'Azure, seleccioneu Habilita l'enllaç privat. Per obtenir més informació, aneu a Enllaços privats.

  8. Per crear un esquema nou, aneu a Crea un fitxer d'esquema nou.

  9. Per utilitzar un esquema existent, aneu a la carpeta que conté el fitxer model.json o manifest.cdm.json. Podeu cercar dins d'un directori per trobar el fitxer.

  10. Seleccioneu el fitxer json i seleccioneu Següent. Es mostra una llista de taules disponibles. Quadre de diàleg d'una llista de taules per seleccionar

  11. Seleccioneu les taules que voleu incloure. Quadre de diàleg que mostra Necessari per a la clau primària

    Tip

    Per editar una taula en una interfície d'edició JSON, seleccioneu la taula i, a continuació, edita el fitxer d'esquema. Feu canvis i seleccioneu Desa.

  12. Per a les taules seleccionades que requereixen ingesta incremental, Obligatori es mostra a Actualització incremental. Per a cadascuna d'aquestes taules, vegeu Configurar una actualització incremental per a les fonts de dades de l'Azure Data Lake.

  13. Per a les taules seleccionades on no hi ha una clau primària, Obligatori es mostra a Clau primària. Per a cadascuna d'aquestes taules:

    1. Seleccioneu Obligatori. Es mostra el tauler Edita la taula .
    2. Trieu la clau principal. La clau primària és un atribut únic de la taula. Perquè un atribut sigui una clau primària vàlida, no ha d'incloure valors duplicats, valors que falten o valors nuls. Els atributs de tipus de dades de cadena, enter i GUID s'admeten com a claus primàries.
    3. Opcionalment, canvieu el patró de partició.
    4. Seleccioneu Tanca per desar i tancar el tauler.
  14. Seleccioneu el nombre de columnes per a cada taula inclosa. Es mostra la pàgina Gestiona els atributs . Quadre de diàleg per seleccionar la creació de perfils de dades.

    1. Creeu columnes noves, editeu o suprimiu columnes existents. Podeu canviar el nom, el format de dades o afegir un tipus semàntic.
    2. Per habilitar l'anàlisi i altres capacitats, seleccioneu Perfils de dades per a tota la taula o per a columnes específiques. Per defecte, no hi ha cap taula habilitada per a la creació de perfils de dades.
    3. Seleccioneu Fet.
  15. Seleccioneu Desa. S'obre la pàgina Fonts de dades que mostra la nova font de dades en estat d'actualització .

    Tip

    Selecciona un estat per obrir el panell de detalls de progrés , on pots veure el procés de la tasca o selecciona Cancel·la feina per aturar la feina.

La càrrega de dades pot trigar temps. Després d'una actualització correcta, les dades ingerides es poden revisar des de la pàgina Taules .

Crear un fitxer d'esquema nou

  1. Seleccioneu Crea un fitxer d'esquema.

  2. Introduïu un nom per al fitxer i seleccioneu Desa.

  3. Seleccioneu Taula nova. Es mostra el tauler Nova taula .

  4. Introduïu el nom de la taula i trieu la ubicació dels fitxers de dades.

    • Diversos fitxers .csv o .parquet: navegueu a la carpeta arrel, seleccioneu el tipus de patró i introduïu l'expressió.
    • Fitxers .csv o .parquet individuals: navegueu fins al fitxer .csv o .parquet i seleccioneu-lo.

    Quadre de diàleg per crear una taula nova amb la ubicació dels fitxers de dades ressaltada.

  5. Seleccioneu Desa.

    Quadre de diàleg per definir o generar automàticament atributs.

  6. Seleccioneu defineix els atributs per afegir-los manualment o seleccioneu Genera'ls automàticament. Per definir els atributs, introduïu un nom, seleccioneu el format de dades i el tipus semàntic opcional. Per als atributs generats automàticament:

    1. Un cop generats automàticament els atributs, seleccioneu Revisa atributs. Es mostra la pàgina Gestiona els atributs .

    2. Assegureu-vos que el format de les dades sigui correcte per a cada atribut.

    3. Per habilitar l'anàlisi i altres capacitats, seleccioneu Perfils de dades per a tota la taula o per a columnes específiques. Per defecte, no hi ha cap taula habilitada per a la creació de perfils de dades.

      Quadre de diàleg per seleccionar la creació de perfils de dades.

    4. Seleccioneu Fet. Es mostra la pàgina Selecciona taules .

  7. Continueu afegint taules i columnes, si escau.

  8. Després d'afegir totes les taules, seleccioneu Inclou per incloure les taules a la ingesta de la font de dades.

    Quadre de diàleg que mostra Necessari per a la clau primària

  9. Per a les taules seleccionades que requereixen ingesta incremental, Obligatori es mostra a Actualització incremental. Per a cadascuna d'aquestes taules, vegeu Configurar una actualització incremental per a les fonts de dades de l'Azure Data Lake.

  10. Per a les taules seleccionades on no hi ha una clau primària, Obligatori es mostra a Clau primària. Per a cadascuna d'aquestes taules:

    1. Seleccioneu Obligatori. Es mostra el tauler Edita la taula .
    2. Trieu la clau principal. La clau primària és un atribut únic de la taula. Perquè un atribut sigui una clau primària vàlida, no ha d'incloure valors duplicats, valors que falten o valors nuls. Els atributs de tipus de dades de cadena, enter i GUID s'admeten com a claus primàries.
    3. Opcionalment, canvieu el patró de partició.
    4. Seleccioneu Tanca per desar i tancar el tauler.
  11. Seleccioneu Desa. S'obre la pàgina Fonts de dades que mostra la nova font de dades en estat d'actualització .

La càrrega de dades pot trigar temps. Després d'una actualització correcta, les dades ingerides es poden revisar des de la pàgina Taules de>.

Editar una font de dades de l'Azure Data Lake Storage

Podeu actualitzar l'opció Connecta't al compte d'emmagatzematge usant . Per obtenir més informació, vegeu Connectar-se a un compte de l'Azure Data Lake Storage amb una entitat de servei del Microsoft Entra. Per connectar-vos a un contenidor diferent del compte d'emmagatzematge o canviar el nom del compte, creeu una connexió de font de dades nova.

  1. Aneu aFonts de dades de >. Al costat de la font de dades que vulgueu actualitzar, seleccioneu Edita.

  2. Canvieu qualsevol de les dades següents:

    • Descripció

    • Connecteu l'emmagatzematge mitjançant la informació de connexió. No podeu canviar la informació del contenidor quan actualitzeu la connexió.

      Nota

      S'ha d'assignar una de les funcions següents al compte d'emmagatzematge o al contenidor:

      • Lector de dades de blobs d'emmagatzematge
      • Propietari de dades de blob d'emmagatzematge
      • Col·laborador de dades blob d'emmagatzematge
    • Habiliteu l'enllaç privat si voleu ingerir dades d'un compte d'emmagatzematge mitjançant un enllaç privat de l'Azure. Per obtenir més informació, aneu a Enllaços privats.

  3. Seleccioneu Següent.

  4. Canvieu qualsevol de les dades següents:

    • Aneu a un fitxer model.json o manifest.json diferent amb un conjunt de taules diferent del contenidor.

    • Per afegir més taules a la ingesta, seleccioneu Taula nova.

    • Per eliminar les taules ja seleccionades si no hi ha dependències, seleccioneu la taula i suprimeix.

      Important

      Si hi ha dependències del fitxer model.json o manifest.json existent i del conjunt de taules, veureu un missatge d'error i no podeu seleccionar un altre fitxer model.json o manifest.json. Suprimiu aquestes dependències abans de canviar el fitxer model.json o manifest.json o creeu una font de dades nova amb el fitxer model.json o manifest.json que vulgueu utilitzar per evitar suprimir les dependències.

    • Per canviar la ubicació del fitxer de dades o la clau principal, seleccioneu Edita.

    • Per canviar les dades d'ingesta incremental, vegeu Configurar una actualització incremental per a les fonts de dades de l'Azure Data Lake.

    • Canvieu només el nom de la taula perquè coincideixi amb el nom de la taula del fitxer .json.

      Nota

      Mantingueu sempre el nom de la taula igual que el nom de la taula al fitxer model.json o manifest.json després de la ingestió. Customer Insights - Les dades validen tots els noms de taula amb el model.json o el manifest.json durant cada actualització del sistema. Si canvia el nom d'una taula, es produeix un error perquè el Customer Insights - Dades no pot trobar el nom de taula nou al fitxer .json. Si s'ha canviat accidentalment el nom d'una taula ingerida, editeu-lo perquè coincideixi amb el nom del fitxer .json.

  5. Seleccioneu Columnes per afegir-les o canviar-les, o per habilitar la creació de perfils de dades. A continuació, seleccioneu Fet.

  6. Seleccioneu Desa per aplicar els canvis i tornar a la pàgina Fonts de dades .

Actualitzar una font de dades quan canviï l'esquema

Si es canvia l'esquema de les dades d'origen després de crear la connexió de la font de dades, apareixerà una manca de concordança d'esquema o un error de coincidència de dades que us demanarà que actualitzeu la connexió de la font de dades. L'error "Les columnes de les dades d'origen han canviat" es mostra als detalls de la tasca. Els canvis d'esquema inclouen actualitzacions de columnes, noms de columna i tipus de dades de columna.

  1. Aneu aFonts de dades de >. Seleccioneu Edita al costat de la font de dades amb els errors. A continuació, seleccioneu Següent.

  2. Seleccioneu la taula que té errors.

    Captura de pantalla de la pàgina Administra atributs que mostra el missatge de generació automàtica d'atributs.

  3. Seleccioneu Genera automàticament els atributs i confirmeu.

  4. Un cop finalitzada la generació d'atributs, seleccioneu Fet.

  5. Seleccioneu Inclou a la taula i, a continuació, seleccioneu Desa per aplicar els canvis i tornar a la pàgina Fonts de dades .

Evitar fragments de partició a la ingesta de Data Lake

És possible que la vostra estratègia de partició del llac de dades pugui crear centenars de milers de particions petites, com ara una nova partició per a cada entitat cada hora. Per evitar la fragmentació de les particions, seguiu aquestes pràctiques recomanades:

  • Eviteu la partició excessiva: la partició s'ha de basar en columnes de baixa cardinalitat, com ara data o regió, en lloc de camps d'alta cardinalitat com l'identificador d'entitat o l'hora.
  • Per reduir la sobrecàrrega d'obrir i tancar molts fitxers petits i millorar el rendiment de lectura, preveu fitxers de partició d'entre 16 MB i 1 GB.
  • Utilitzeu Delta Lake, que proporciona funcions d'optimització automàtica: Delta Lake admet la compactació automàtica i optimitza les funcions d'escriptura que gestionen automàticament les mides dels fitxers i el disseny de les particions. Al Databricks Runtime 11.3 i versions posteriors, Delta Lake ajusta automàticament les mides i les particions dels fitxers en segon pla.
  • Reavalueu periòdicament l'estratègia de particions: a mesura que evolucionen el volum de dades i els patrons d'accés, també ho hauria de fer la vostra estratègia de particions. Utilitzeu eines com ara estadístiques d'omissió de dades i perfils de consultes per guiar els ajustos.

Centenars de milers de particions petites poden causar els símptomes següents:

  • Degradació del rendiment durant la ingesta de dades i l'execució de consultes.
  • Augment de la sobrecàrrega i la latència de les metadades.
  • Costos operatius més elevats a causa de l'emmagatzematge ineficient i l'ús informàtic.
  • Errors quan el nombre de particions supera les limitacions d'un servei.
  • Errors de memòria insuficient quan el sistema intenta crear un gràfic per a cada partició.