Nota
L'accés a aquesta pàgina requereix autorització. Podeu provar d'iniciar la sessió o de canviar els directoris.
L'accés a aquesta pàgina requereix autorització. Podeu provar de canviar els directoris.
L'actualització incremental per a fonts de dades basades en Azure Data Lake Storage ofereix els avantatges següents:
- Actualitzacions més ràpides : només s'actualitzen les dades que han canviat. Per exemple, podeu actualitzar només els darrers cinc dies d'un conjunt de dades històric.
- Augment de la fiabilitat : amb actualitzacions més petites, no cal que mantingueu connexions a sistemes d'origen volàtils durant tant de temps, reduint el risc de problemes de connexió.
- Consum reduït de recursos : actualitzar només un subconjunt de les dades totals condueix a un ús més eficient dels recursos informàtics i disminueix la petjada ambiental.
Configurar l'actualització incremental per a fonts de dades de l'Azure Data Lake Storage
Microsoft recomana el format Delta Lake per obtenir el millor rendiment i resultats per treballar amb grans conjunts de dades. Customer Insights - Les dades proporcionen un connector optimitzat per a dades amb format Delta Lake. Els processos interns com la unificació s'optimitzen per processar de manera incremental només les dades canviades, donant lloc a temps de processament més curts.
Per utilitzar la ingesta i l'actualització incrementals d'una taula del Data Lake, configureu-la quan afegiu o editeu la font de dades de l'Azure Data Lake. La carpeta de dades de la taula ha de contenir les carpetes següents:
- FullData: carpeta amb fitxers de dades que contenen registres inicials
- IncrementalData: carpeta amb carpetes de jerarquia de data i hora en format aaaa/mm/dd/hh que conté les actualitzacions incrementals. S'espera que les carpetes d'any, mes, dia i hora siguin de quatre i dos dígits respectivament. hh representa l'hora UTC de les actualitzacions i conté les carpetes Upserts i Deletes . Upserts conté fitxers de dades amb actualitzacions de registres existents o registres nous. Suprimeix conté fitxers de dades amb registres que s'han de suprimir.
Ordre de processament de dades incrementals
El sistema processa els fitxers de la carpeta IncrementalDataun cop finalitzada l'hora UTC especificada. Per exemple, si el sistema comença a processar l'actualització incremental el 21 de gener de 2023 a les 8:15, es processen tots els fitxers que es troben a la carpeta 2023/01/21/07 (que representen fitxers de dades emmagatzemats de 7 a 8 del matí). Els fitxers de la carpeta 2023/01/21/08 (que representen l'hora actual en què encara s'estan generant els fitxers) no es processen fins a la següent execució.
Si hi ha dos registres per a una clau primària, un upsert i un delete, Customer Insights - Data utilitza el registre amb la data de modificació més recent. Per exemple, si la marca de temps de supressió és 2023-01-21T08:00:00 i la marca de temps upsert és 2023-01-21T08:30:00, utilitza el registre upsert. Si la supressió s'ha produït després de l'actualització, el sistema assumeix que el registre s'ha suprimit.
Configurar l'actualització incremental per a les fonts de dades de l'Azure Data Lake
Quan afegiu o editeu una font de dades, aneu a la subfinestra Atributs de la taula.
Reviseu els atributs. Assegureu-vos que un atribut de data creat o darrera actualització estigui configurat amb un format dateTimeData i un tipus semànticCalendar.Date. Editeu l'atribut si cal i seleccioneu Fet.
A la subfinestra Selecciona taules , editeu la taula. La casella de selecció Ingesta incremental està activada.
- Navegueu fins a la carpeta arrel que conté els fitxers .csv o .parquet per obtenir dades completes, actualitzacions de dades incrementals i supressions de dades incrementals.
- Introduïu l'extensió per a les dades completes i els dos fitxers incrementals (.csv o .parquet).
- Per a .csv fitxers, seleccioneu el delimitador de columna i si voleu la primera fila del fitxer com a capçalera de columna.
- Seleccioneu Desa.
Per a Darrera actualització, seleccioneu l'atribut de marca de data i hora.
Si la clau principal no està seleccionada, seleccioneu-la. La clau primària és un atribut únic de la taula. Perquè un atribut sigui una clau primària vàlida, no ha d'incloure valors duplicats, valors que falten o valors nuls. Els atributs de tipus de dades de cadena, enter i GUID s'admeten com a claus primàries.
Seleccioneu Tanca per desar i tancar la subfranja.
Continueu afegint o editant la font de dades.
Executar una actualització completa única per a les fonts de dades de l'Azure Data Lake
Després de configurar una actualització incremental per a les fonts de dades de l'Azure Data Lake, hi ha moments en què les dades s'han de processar amb una actualització completa. La carpeta de dades completa configurada per a l'actualització incremental ha de contenir la ubicació de les dades completes.
Quan editeu la font de dades, aneu a la subfinestra Selecciona taules i editeu la taula que voleu actualitzar.
A la subfinestra Edita la taula , desplaceu-vos fins a la casella Executa l'actualització completa única i seleccioneu-la.
Per a Processa fitxers incrementals des de, especifiqueu la data i l'hora de conservar els fitxers incrementals. Les dades completes més les dades incrementals comencen a processar-se després de la data i l'hora especificades. Per exemple, si voleu dur a terme una actualització parcial de les dades fins a finals de novembre mentre conserveu les dades incrementals des de principis de desembre fins avui (30 de desembre), introduïu l'1 de desembre. Per substituir totes les dades i ignorar les dades de la carpeta incremental, especifiqueu una data futura.
Seleccioneu Tanca per desar i tancar la subfranja.
Seleccioneu Desa per aplicar els canvis i tornar a la pàgina Fonts de dades . La font de dades està en estat d'actualització, realitzant una actualització completa.