Muistiinpano
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää kirjautua sisään tai vaihtaa hakemistoa.
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää vaihtaa hakemistoa.
Koskee:✅ Microsoft Fabric -varasto
Warehouse in Microsoft Fabric tarjoaa sisäänrakennetut tiedon vastaanottotyökalut. Käytä näitä työkaluja datan siirtämiseen varastoihin laajassa mittakaavassa käyttäen koodittomia tai koodirikkaita kokemuksia.
Valitse datan vastaanottotyökalu
Valitse datan vastaanottovaihtoehto seuraavien kriteerien perusteella:
- Käytä COPY (Transact-SQL) -lausetta koodirikkaisiin datan vastaanottotoimintoihin. Se tarjoaa korkeimman datan vastaanottonopeuden. Käytä sitä, kun sinun täytyy lisätä datan vastaanotto osaksi Transact-SQL logiikkaa.
- Aloittaaksesi katso Ingest data COPY-lauseella.
- The Warehouse tukee myös perinteistä
BULK INSERTyhteensopivuusperiaatetta. Vuonna Fabric tietovarasto tämä lauseke vastaaCOPY INTOkäyttäytymistä klassisilla latausasetuksilla. - Warehousen lauseke
COPYtukee tietolähteitä Azure-tallennustileiltä ja OneLake Lakehouse -kansioista.
- Käytä BCP API:ta (Preview) suoraan asiakaspuolen vastaanottoon, kun data on sovellustasolla eikä tiedostoja voi vaiheistaa ensin.
- Aloittaaksesi katso Ingest data using BCP API (Preview).
- BCP API tukee bcp.exe skriptejä ja sovellusrajapintoja, kuten C#
SqlBulkCopyja JavaSQLServerBulkCopy. - Suurimman läpimenon tiedostopohjaiseen vastaanottoon kannattaa
COPY INTOsuosia, kun vaiheitus on mahdollista.
- Käytä putkia koodittomiin tai vähäkoodattuihin, vahvoihin datan vastaanottotyönkulkuihin, jotka toimivat toistuvasti, aikataulun mukaan tai sisältävät suuria määriä dataa.
- Aloittaaksesi katso Tietojen syöttö varastoosi putkiston avulla.
- Putkia käyttämällä voit järjestää vahvoja työnkulkuja täydellisen Extract, Transform, Load (ETL) -kokemuksen saavuttamiseksi. Tämä kokemus sisältää toimintoja, jotka auttavat valmistautumaan kohdeympäristöön, ajamaan mukautettuja Transact-SQL-lauseita, suorittamaan hakuja tai kopioimaan dataa lähteestä kohteeseen.
- Käytä datavirtoja koodivapaaseen kokemukseen, joka mahdollistaa mukautetut muunnokset datan lähteeksi ennen niiden vastaanottoa.
- Aloittaaksesi katso Ingest data using a dataflow.
- Näitä muunnoksia ovat esimerkiksi tietotyyppien muuttaminen, sarakkeiden lisääminen tai poistaminen tai laskettujen sarakkeiden luominen funktioiden avulla.
-
Käytä T-SQL-käsittelyä koodirikkaisiin kokemuksiin, jotta voit luoda uusia taulukoita tai päivittää aiemmin luotuja taulukoita lähdetiedoilla samassa työtilassa tai ulkoisessa tallennustilassa.
- Aloittaaksesi katso Tietojen sisäänpääsy varastoosi Transact-SQL:n avulla.
- Käytä Transact-SQL ominaisuuksia kuten
INSERT...SELECT,SELECT INTOtaiCREATE TABLE AS SELECT (CTAS)lukeaksesi tietoja tauluista, jotka viittaavat muihin varastoihin, järvimajoihin tai peilattuihin tietokantoihin samassa työtilassa. Voit myös käyttää näitä ominaisuuksia lukeaksesi dataaOPENROWSET-funktiosta, joka viittaa tiedostoihin ulkoisissa Azure tallennustileillä. - Voit myös kirjoittaa tietokantakyselyitä eri varastojen välillä Fabric työtilassasi.
Tuetut tietomuodot ja lähteet
Warehouse-datan vastaanotto Microsoft Fabric -ohjelmassa tukee monia tietomuotoja ja lähteitä. Jokainen tässä artikkelissa kuvattu vaihtoehto sisältää oman listansa tuetuista liitintyypeistä ja tietomuodoista.
T-SQL ingestion -tietolähteiden täytyy olla samassa Microsoft Fabric-työtilassa ja tiedostolähteiden on oltava Azure Data Lake tai Azure Blob-tallennustilassa. Voit hakea tietoja käyttämällä kolmiosaista nimeämistä tai lähdedatan OPENROWSET funktiota. Taulukon tietolähteet voivat viitata Delta Lake -aineistoihin, kun taas OPENROWSET voi viitata Parquet-, CSV- tai JSONL-tiedostoihin Azure Data Lake- tai Azure Blob-tallennustilassa.
Esimerkiksi oletetaan, että työtilassa on kaksi varastoa, nimeltään Inventory ja Sales. Seuraava kysely luo varastoon uuden taulukon Inventory , jossa varaston taulun Inventory sisältö yhdistetään varaston tauluun Sales ja ulkoiset tiedostot, jotka sisältävät asiakastietoja:
CREATE TABLE Inventory.dbo.RegionalSalesOrders
AS
SELECT
s.SalesOrders,
i.ProductName,
c.CustomerName
FROM Sales.dbo.SalesOrders s
JOIN Inventory.dbo.Products i
ON s.ProductID = i.ProductID
JOIN OPENROWSET( BULK 'abfss://<container>@<storage>.dfs.core.windows.net/<customer-file>.csv' ) AS c
ON s.CustomerID = c.CustomerID
WHERE s.Region = 'West region';
Note
Datan lukeminen voi OPENROWSET olla hitaampaa kuin datan kysely taulukosta. Jos aiot käyttää samoja ulkoisia tietoja toistuvasti, harkitse niiden siirtämistä erilliseen taulukkoon suorituskyvyn ja kyselyn tehokkuuden parantamiseksi.
COPY (Transact-SQL) tukee tällä hetkellä CSV-, JSONL- ja PARQUET-tiedostomuotoja. Tietolähteissä tuetaan tällä hetkellä Azure Data Lake Storage (ADLS) Gen2:ta ja Azure Blob -säilöä.
Suorissa asiakaspuolen vastaanottotilanteissa BCP API (Preview) tukee työkaluja ja rajapintoja kuten bcp.exe, C# SqlBulkCopyja Java SQLServerBulkCopy SQL-yhteyksien yli ilman tiedostojen vaiheittamista ensin.
Putket ja tietovuot tukevat monenlaisia tietolähteitä ja tietomuotoja. Lisätietoja on kohdassa Putket ja tietovuot.
Parhaat käytännöt
COPY-komento Warehousessa Microsoft Fabric tarjoaa yksinkertaisen, joustavan ja nopean käyttöliittymän SQL-työkuormien korkean läpimenon datan vastaanottoon. Nykyisessä versiossa se tukee datan lataamista vain ulkoisista tallennustileistä.
Voit myös käyttää T-SQL-kieltä uuden taulukon luomiseen ja sen lisäämiseen sekä tietorivien päivittämiseen ja poistamiseen. Voit lisätä tietoja mistä tahansa tietokannasta Microsoft Fabric -työtilassa käyttämällä tietokantakyselyitä. Jos haluat käyttää Tietoja Lakehousesta varastoon, voit tehdä sen tietokannan välisen kyselyn avulla. Esimerkki:
INSERT INTO MyWarehouseTable
SELECT * FROM MyLakehouse.dbo.MyLakehouseTable;
- Vältä datan vastaanottamista käyttämällä singleton-lauseita
INSERT, sillä tämä lähestymistapa heikentää suorituskykyä kyselyissä ja päivityksissä. Jos käytät singleton-lauseitaINSERTdatan vastaanottoon peräkkäin, luo uusi taulukko käyttämälläCREATE TABLE AS SELECT (CTAS)taiINSERT...SELECTkuvioita, poista alkuperäinen taulu ja luo taulu uudelleen siitä taulukosta, jonka loit käyttämälläCREATE TABLE AS SELECT (CTAS).- Aiemmin luodun taulukon pudottaminen vaikuttaa semanttiseen malliin, mukaan lukien mahdollisiin mukautettuihin mittareihin ja mukautuksiin, jotka olet ehkä tehnyt semanttiseen malliin.
- Kun työskentelet ulkoisen datan kanssa tiedostoissa, varmista, että tiedostot ovat vähintään 4 MB kokoisia.
- Jos kyseessä on suuri pakattu CSV-tiedosto, harkitse tiedoston jakamista useisiin tiedostoihin.
- Azure Data Lake Storage (ADLS) Gen2 tarjoaa paremman suorituskyvyn kuin Azure Blob -säilö (vanha). Harkitse ADLS Gen2 -tilin käyttämistä aina kun se on mahdollista.
- Usein suoritettavissa jaksoissa sinun kannattaa eristää Azure-tallennustilisi muista palveluista, jotka voisivat käyttää samoja tiedostoja samanaikaisesti.
- Eksplisiittisten tapahtumien avulla voit ryhmitellä useita tietojen muutoksia yhteen niin, että ne näkyvät vain lukiessa yhtä tai useampaa taulukkoa, kun tapahtuma on täysin varattu. Voit myös peruuttaa tapahtuman, jos jokin muutoksista epäonnistuu.
- Jos a
SELECTon transaktion sisällä ja sitä edelsi tietojen lisääminen, automaattisesti generoidut tilastot voivat olla virheellisiä, kun palautus on tehty. Virheelliset tilastot voivat johtaa optimoimattomaan kyselysuunnitelmiin ja suoritusaikoihin. Jos palautat transaktion, jossaSELECTs on suurenINSERT, päivitä tilastot niille sarakkeille, jotka mainitaan sarakkeissaSELECT.
Note
Riippumatta siitä, miten tallennat dataa varastoihin, datan vastaanottotehtävä optimoi tuottamansa parquet-tiedostot V-Order-kirjoitusoptimoinnin avulla. V-Order optimoi parquet-tiedostot, jotta salamannopeat lukutoiminnot voidaan ottaa käyttöön Microsoft Fabric -käsittelymoduulissa, kuten Power BI:ssä, SQL:ssä ja Sparkissä. Varastokyselyt hyötyvät yleisesti nopeammista lukuajoista tällä optimoinnilla, mutta varmistavat silti, että parquet-tiedostot ovat 100% yhteensopivia avoimen lähdekoodin määrittelyn kanssa. Älä poista V-Orderia käytöstä, sillä se voi vaikuttaa lukusuoritukseen. Lisätietoja V-järjestyksestä on artikkelissa V-Order for Warehousen ymmärtäminen ja hallinta.
Usein kysytyt kysymykset datan vastaanotosta Fabric tietovarasto
Mikä on tiedostojen jakamisohje COPY-komennolle, joka lataa pakattuja CSV-tiedostoja?
Harkitse suurten CSV-tiedostojen jakamista, erityisesti kun tiedostoja on vähän, mutta pidä tiedostot vähintään 4 MB kappaleessa paremman suorituskyvyn vuoksi.
Mikä on tiedostojen jakamisohje COPY-komennolla, joka lataa Parquet-tiedostoja?
Harkitse suurten Parquet-tiedostojen jakamista, erityisesti kun tiedostoja on vähän.
Onko tiedostojen määrälle tai koolle rajoituksia?
Tiedostojen määrälle tai koolle ei ole rajoituksia. Parhaan suorituskyvyn saavuttamiseksi käytä kuitenkin vähintään 4 Mt kokoisia tiedostoja.
Mitä todennusmenetelmää COPY-komento käyttää, jos en määritä tunnistetietoja?
Oletuksena COPY INTO käyttää suorittavan käyttäjän Microsoft Entra ID.