Märkus.
Juurdepääs sellele lehele nõuab autoriseerimist. Võite proovida sisse logida või kausta vahetada.
Juurdepääs sellele lehele nõuab autoriseerimist. Võite proovida kausta vahetada.
Märkus.
Azure Active Directory on nüüd Microsoft Entra ID. Lisateave
Andmete sisestamine rakendusse Dynamics 365 Customer Insights – andmed, kasutades oma Azure Data Lake Storage'i kontot koos Common Data Modeli tabelitega. Andmete sisestamine võib olla täielik või järkjärguline.
eeltingimused
Azure Data Lake Storage'i kontol peab olema hierarhiline nimeruum lubatud. Andmed peavad olema talletatud hierarhilises kaustavormingus, mis määratleb juurkausta ja millel on iga tabeli jaoks alamkaustad. Alamkaustades võivad olla täielikud andmekaustad või inkrementaalsed andmekaustad.
Microsoft Entra teenusesubjektiga autentimiseks peab see olema teie rentnikus konfigureeritud. Lisateavet leiate teemast Azure Data Lake Storage'i kontoga ühenduse loomine Microsoft Entra teenusesubjektiga.
Tulemüüriga kaitstud salvestusruumiga ühenduse loomiseks häälestage Azure'i privaatsed lingid.
Kui teie andmejärvel on praegu privaatse lingi ühendusi, peavad Customer Insights – andmed looma ühenduse ka privaatse lingi kaudu, olenemata võrgule juurdepääsu sättest.
Azure Data Lake Storage, mida soovite ühendada ja kust andmeid sisestada, peab asuma Dynamics 365 Customer Insightsi keskkonnaga samas Azure'i piirkonnas ja kordustellimused peavad olema samas rentnikus. Ühendusi Common Data Modeli kaustaga mõnes muus Azure'i piirkonnas asuvast andmejärvest ei toetata. Keskkonna Azure'i piirkonna teadasaamiseks minge jaotisse >> Teave jaotises Customer Insights – andmed.
Võrguteenustes salvestatud andmeid võidakse talletada mujal kui see, kus andmeid töödeldakse või talletatakse. Võrguteenustes salvestatud andmete importimisel või nendega ühenduse loomisel nõustute, et andmeid saab edastada. Lisateavet leiate Microsofti usalduskeskusest.
Customer Insights – andmeteenuse subjektil peab salvestusruumikontole juurdepääsuks olema üks järgmistest rollidest. Lisateavet leiate teemast Teenuse subjektile salvestuskontole juurdepääsu õiguste andmine.
- Salvestusruumi bloobiandmete lugeja
- Salvestusruumi bloobiandmete omanik
- Salvestusruumi bloobiandmete kaasautor
Kui loote ühenduse oma Azure'i salvestusruumiga Azure'i tellimuse valiku abil, peab andmeallika ühenduse häälestav kasutaja olema salvestusruumi konto jaoks vähemalt salvestusruumi bloobiandmete kaastöötaja õigused.
Kui loote ühenduse oma Azure'i salvestusruumiga Azure'i ressursisuvandi abil, peab andmeallika ühenduse häälestav kasutaja olema vähemalt salvestusruumi konto toimingu Microsoft.Storage/storageAccounts/read õigus. Seda toimingut sisaldav Azure'i sisseehitatud roll on lugeja roll. Juurdepääsu piiramiseks ainult vajalikule toimingule looge Azure'i kohandatud roll , mis sisaldab ainult seda toimingut.
Optimaalse jõudluse tagamiseks peaks partitsiooni suurus olema 1 GB või vähem ja sektsioonifailide arv kaustas ei tohi ületada 1000.
Data Lake Storage'is olevad andmed peaksid järgima teie andmete talletamiseks Common Data Modeli standardit ja neil peaks olema Common Data Modeli manifest, mis esindab andmefailide skeemi (*.csv või *.parquet). Manifest peab sisaldama tabelite üksikasju (nt tabeli veerud ja andmetüübid) ning andmefaili asukohta ja failitüüpi. Lisateavet leiate teemast Common Data Modeli manifest. Kui manifesti pole, saavad salvestusruumi bloobiandmete omaniku või salvestusruumi bloobiandmete kaasautori juurdepääsuga administraatorikasutajad andmete sisestamisel skeemi määratleda.
Märkus.
Kui mõne parquet-faili välja andmetüüp on Int96, ei pruugita andmeid lehel Tabelid kuvada. Soovitame kasutada standardseid andmetüüpe, näiteks Unixi ajatempli vormingut (mis tähistab aega sekundite arvuna alates 1. jaanuarist 1970 keskööl UTC).
Piirangud
- Customer Insights – andmed ei toeta kümnendtüüpi veerge, mille täpsus on suurem kui 16.
Ühenduse loomine Azure Data Lake Storage'iga
Andmeühenduste nimed, andmeteed (nt ümbrises olevad kaustad) ja tabelinimed peavad kasutama tähega algavaid nimesid. Nimed võivad sisaldada ainult tähti, numbreid ja allkriipsu (_). Erimärke ei toetata.
Minge jaotisse Andmeallikad>.
Valige Lisa andmeallikas.
Sisestage andmeallika nimi ja valikuline kirjeldus. Nimele viidatakse allavoolu protsessides ja pärast andmeallika loomist pole seda võimalik muuta.
Valige üks järgmistest suvanditest Salvestusruumi ühendamine abil. Lisateavet leiate teemast Azure Data Lake Storage'i kontoga ühenduse loomine Microsoft Entra teenusesubjektiga.
- Azure'i ressurss: sisestage ressursi ID.
- Azure'i tellimus: valige tellimus ja seejärel ressursirühm ja salvestusruumi konto.
Märkus.
Andmeallika loomiseks on konteineri jaoks vaja ühte järgmistest rollidest.
- Storage bloobiandmete lugejast piisab salvestusruumikontolt lugemiseks ja andmete sisestamiseks Customer Insightsi – andmetesse.
- Salvestusruumi bloobiandmete kaastöötaja või omanik on nõutav, kui soovite manifestifaile redigeerida otse rakenduses Customer Insights – andmed.
Roll salvestuskontol annab sama rolli kõigis selle konteinerites.
Valige selle konteineri nimi, mis sisaldab andmeid ja skeemi (model.json või manifest.json fail), kust andmeid importida.
Märkus.
Keskkonna mõne muu andmeallikaga seotud model.json või manifest.json faili loendis ei kuvata. Sama model.json või manifest.json faili saab aga kasutada mitmes keskkonnas asuvate andmeallikate jaoks.
Kui soovite salvestusruumikontolt andmeid Azure Private Linki kaudu sisse laadida, valige Luba privaatne link. Lisateabe saamiseks minge jaotisse Privaatsed lingid.
Uue skeemi loomiseks minge jaotisse Uue skeemifaili loomine.
Olemasoleva skeemi kasutamiseks liikuge kausta, mis sisaldab model.json või manifest.cdm.json faili. Faili leidmiseks saate otsida kataloogist.
Valige json-fail ja valige Edasi. Kuvatakse saadaolevate tabelite loend.
Valige tabelid, mida soovite kaasata.
Otsa
Tabeli redigeerimiseks JSON-i redigeerimisliideses valige tabel ja seejärel Redigeeri skeemifaili. Tehke muudatused ja valige Salvesta.
Valitud tabelite puhul, mis nõuavad järkjärgulist sissevõtmist, kuvatakse jaotises Inkrementaalne värskendamineväärtus Nõutav. Kõigi nende tabelite kohta vaadake teemat Azure Data Lake'i andmeallikate järkjärgulise värskendamise konfigureerimine.
Valitud tabelite puhul, kus primaarvõtit pole määratletud, kuvatakse jaotises Primaarvõti väärtus Nõutav. Iga tabeli puhul:
- Valige Nõutav. Kuvatakse paan Redigeeri tabelit .
- Valige primaarvõti. Primaarvõti on tabeli ainulaadne atribuut. Selleks, et atribuut oleks kehtiv primaarvõti, ei tohiks see sisaldada duplikaatväärtusi, puuduvaid väärtusi ega tühiväärtusi. Stringi, täisarvu ja GUID andmetüübi atribuute toetatakse primaarvõtmetena.
- Soovi korral muutke partitsioonimustrit.
- Paneeli salvestamiseks ja sulgemiseks valige Sule.
Valige iga kaasatud tabeli veergude arv. Kuvatakse leht Atribuutide haldamine .
- Looge uusi veerge, redigeerige või kustutage olemasolevaid veerge. Saate muuta nime, andmevormingut või lisada semantilise tüübi.
- Analüüsi ja muude võimaluste lubamiseks valige Andmete profiilianalüüs kogu tabeli või kindlate veergude jaoks. Vaikimisi pole ükski tabel andmete profiilide koostamiseks lubatud.
- Valige Valmis.
Valige käsk Salvesta. Avaneb leht Andmeallikad , kus kuvatakse uus andmeallikas olekus Värskendamine .
Otsa
Vali staatus, et avada Edenemise detailide paneer, kus saad vaadata ülesande edenemist või valida Tühista töö , et töö peatada.
Andmete laadimine võib võtta aega. Pärast edukat värskendamist saab sisestatud andmeid üle vaadata lehel Tabelid .
Uue skeemifaili loomine
Valige Loo skeemifail.
Sisestage faili nimi ja valige Salvesta.
Valige Uus tabel. Kuvatakse paneel Uus tabel .
Sisestage tabeli nimi ja valige andmefailide asukoht.
- Mitu .csv- või .parquet-faili: liikuge sirvides juurkausta, valige mustri tüüp ja sisestage avaldis.
- Üksikud .csv- või parquet-failid: liikuge sirvides .csv- või parquet-failini ja valige see.
Valige käsk Salvesta.
Valige atribuutide käsitsi lisamiseks atribuutide määratlemine või valige nende automaatne loomine. Atribuutide määratlemiseks sisestage nimi, valige andmevorming ja valikuline semantiline tüüp. Automaatselt loodud atribuutide puhul:
Pärast atribuutide automaatset loomist valige Atribuutide ülevaatamine. Kuvatakse leht Atribuutide haldamine .
Veenduge, et iga atribuudi andmevorming oleks õige.
Analüüsi ja muude võimaluste lubamiseks valige Andmete profiilianalüüs kogu tabeli või kindlate veergude jaoks. Vaikimisi pole ükski tabel andmete profiilide koostamiseks lubatud.
Valige Valmis. Kuvatakse leht Tabelite valimine .
Jätkake tabelite ja veergude lisamist, kui see on asjakohane.
Kui kõik tabelid on lisatud, valige Kaasa, et kaasata tabelid andmeallika sisselaadimisse.
Valitud tabelite puhul, mis nõuavad järkjärgulist sissevõtmist, kuvatakse jaotises Inkrementaalne värskendamineväärtus Nõutav. Kõigi nende tabelite kohta vaadake teemat Azure Data Lake'i andmeallikate järkjärgulise värskendamise konfigureerimine.
Valitud tabelite puhul, kus primaarvõtit pole määratletud, kuvatakse jaotises Primaarvõti väärtus Nõutav. Iga tabeli puhul:
- Valige Nõutav. Kuvatakse paan Redigeeri tabelit .
- Valige primaarvõti. Primaarvõti on tabeli ainulaadne atribuut. Selleks, et atribuut oleks kehtiv primaarvõti, ei tohiks see sisaldada duplikaatväärtusi, puuduvaid väärtusi ega tühiväärtusi. Stringi, täisarvu ja GUID andmetüübi atribuute toetatakse primaarvõtmetena.
- Soovi korral muutke partitsioonimustrit.
- Paneeli salvestamiseks ja sulgemiseks valige Sule.
Valige käsk Salvesta. Avaneb leht Andmeallikad , kus kuvatakse uus andmeallikas olekus Värskendamine .
Andmete laadimine võib võtta aega. Pärast edukat värskendamist saab sisestatud andmeid üle vaadata lehel Andmetabelid>.
Azure Data Lake Storage'i andmeallika redigeerimine
Saate värskendada suvandit Loo ühendus salvestusruumikontoga, kasutades suvandit . Lisateavet leiate teemast Azure Data Lake Storage'i kontoga ühenduse loomine Microsoft Entra teenusesubjektiga. Salvestusruumikontost mõne muu konteineriga ühenduse loomiseks või konto nime muutmiseks looge uus andmeallika ühendus.
Minge jaotisse Andmeallikad>. Valige värskendatava andmeallika kõrval Redigeeri.
Muutke järgmist teavet.
Kirjeldus
Ühendage oma salvestusruum ühenduse teabe abil . Ühenduse värskendamisel ei saa konteineri teavet muuta.
Märkus.
Salvestusruumikontole või konteinerile tuleb määrata üks järgmistest rollidest.
- Salvestusruumi bloobiandmete lugeja
- Salvestusruumi bloobiandmete omanik
- Salvestusruumi bloobiandmete kaasautor
Lubage Private Link, kui soovite andmeid salvestusruumikontolt Azure Private Linki kaudu sisse laadida. Lisateabe saamiseks minge jaotisse Privaatsed lingid.
Tehke valik Edasi.
Muutke järgmist teavet.
Navigeerige konteinerist erinevasse model.json või manifest.json faili, millel on erinev tabelikomplekt.
Rohkemate tabelite lisamiseks valige Uus tabel.
Juba valitud tabelite eemaldamiseks, kui sõltuvusi pole, valige tabel ja kustutage.
Oluline
Kui olemasoleval model.json- või manifest.json failil ja tabelikomplektil on sõltuvusi, kuvatakse tõrketeade ja te ei saa valida mõnda muud model.json või manifest.json faili. Eemaldage need sõltuvused enne model.json- või manifest.json faili muutmist või looge sõltuvuste eemaldamise vältimiseks uus andmeallikas model.json või manifest.json failiga, mida soovite kasutada.
Andmefaili asukoha või primaarvõtme muutmiseks valige Redigeeri.
Inkrementaalse sisendi andmete muutmiseks vaadake teemat Azure Data Lake'i andmeallikate järkjärgulise värskendamise konfigureerimine.
Muutke tabeli nime ainult nii, et see vastaks .json failis olevale tabeli nimele.
Märkus.
Hoidke tabeli nimi pärast allavõtmist alati sama, mis tabeli nimi model.json- või manifest.json failis. Customer Insights – andmed valideerivad iga süsteemi värskendamise ajal kõik tabelinimed model.json või manifest.json. Kui tabeli nimi muutub, ilmneb tõrge, kuna Customer Insights – andmed ei leia .json failist uut tabeli nime. Kui sissesisestatud tabeli nime muudeti kogemata, redigeerige tabeli nime nii, et see vastaks .json failis olevale nimele.
Valige Veerud nende lisamiseks või muutmiseks või andmete profiilianalüüsi lubamiseks. Seejärel valige Valmis.
Valige Salvesta, et rakendada muudatused ja naasta lehele Andmeallikad .
Andmeallika värskendamine skeemi muutumisel
Kui lähteandmete skeemi muudetakse pärast andmeallika ühenduse loomist, kuvatakse skeemi mittevastavus või andmete mittevastavuse tõrge, mis palub teil andmeallika ühendust värskendada. Viga "Lähteandmete veerud on muutunud" kuvatakse ülesande üksikasjades. Skeemi muudatused hõlmavad veergude värskendusi, veergude nimesid ja veergude andmetüüpe.
Minge jaotisse Andmeallikad>. Valige tõrgetega andmeallika kõrval Redigeeri. Seejärel valige Edasi .
Valige tõrgetega tabel.
Valige Loo atribuudid automaatselt ja kinnitage.
Kui atribuudi loomine on lõpule viidud, valige Valmis.
Valige tabelis Kaasa ja seejärel valige Salvesta, et rakendada muudatused ja naasta lehele Andmeallikad .
Partitsioonifragmentide vältimine Data Lake'i sisestamisel
Võimalik, et teie andmejärve eraldamise strateegia võib luua sadu tuhandeid väikeseid partitsioone, näiteks iga olemi jaoks iga tunni tagant uue partitsiooni. Partitsioonide killustatuse vältimiseks järgige neid häid tavasid.
- Vältige liigset partitsioneerimist: Partitsioneerimine peaks põhinema madala kardinaalsusega veergudel (nt kuupäev või piirkond), mitte suure kardinaalsusega väljadel (nt olemi ID või tund).
- Optimaalsete failimahtude sihtimine: Paljude väikeste failide avamise ja sulgemise üldkulude vähendamiseks ning lugemisjõudluse parandamiseks püüdke sektsioonifaile vahemikus 16 MB kuni 1 GB.
- Kasutage Delta Lake'i, mis pakub automaatse optimeerimise funktsioone: Delta Lake toetab automaatset tihendamist ja optimeerib kirjutamisfunktsioone, mis haldavad automaatselt faili suurust ja partitsioonipaigutust. Databricks Runtime 11.3 ja uuemates versioonides häälestab Delta Lake taustal automaatselt failide suuruseid ja partitsioone.
- Jagamisstrateegia perioodiline ümberhindamine: andmemahu ja juurdepääsumustrite arenedes peaks seda tegema ka teie sektsioonistrateegia. Kasutage kohanduste juhendamiseks selliseid tööriistu nagu andmete vahelejätmise statistika ja päringute profileerimine.
Sajad tuhanded väikesed vaheseinad võivad põhjustada järgmisi sümptomeid:
- Jõudluse halvenemine andmete sisestamise ja päringu käivitamise ajal.
- Suurenenud metaandmete üldkulud ja latentsusaeg.
- Suuremad tegevuskulud ebaefektiivse salvestus- ja arvutuskasutuse tõttu.
- Tõrked, kui sektsioonide arv ületab teenuse piiranguid.
- Mälu lõppemise vead, kui süsteem üritab luua graafikut igale partitsioonile.