Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
A Databricks a Lakeflow egy végpontok közötti adatmérnöki megoldás, amely lehetővé teszi az adatmérnökök, szoftverfejlesztők, SQL-fejlesztők, elemzők és adattudósok számára, hogy kiváló minőségű adatokat nyújtsanak az alsóbb rétegbeli elemzésekhez, az AI-hoz és az operatív alkalmazásokhoz. A Lakeflow egy egységes megoldás az adatok betöltésére, átalakítására és vezénylésére, beleértve a Lakeflow Connectet, a Lakeflow-folyamatokat, a Lakeflow Designert és a Lakeflow-feladatokat.
Lakeflow Connect
A Lakeflow Connect leegyszerűsíti az adatbetöltést a népszerű vállalati alkalmazásokhoz, adatbázisokhoz, felhőtárhelyekhez, üzenetbuszokhoz és helyi fájlokhoz csatlakozó összekötőkkel. Lásd: Lakeflow Connect.
| Tulajdonság | Leírás |
|---|---|
| Lakeflow Connect | A Lakeflow Connect csatlakozókkal rendelkezik, amelyek adatokat gyűjtenek adatbázisokból, vállalati alkalmazásokból, fájlokból és streaming forrásokból. Válassz teljesen kezelt csatlakozókat minimális működési költség érdekében, vagy szabványos csatlakozókat, hogy szélesebb körű forrásokhoz férj hozzá a pipeline-okon és lekérdezéseken. |
Lakeflow-folyamatok
A Lakeflow-folyamatok csökkentik a hatékony kötegelt és streamelési adatfolyamok létrehozásának és kezelésének összetettségét. Az Apache Spark™ Declarative Pipelinesre (SDP) épülő Lakeflow-folyamatok, vagyis az SQL- és Python-alapú kötegelt és streamingfolyamatok deklaratív keretrendszere, a teljesítményre optimalizált Databricks Runtime-on futnak, és interoperábilisak maradnak vele. Egy folyamatlánc automatikusan vezényli a folyamatok, a nyelők, a streaming táblák és a materializált nézetek végrehajtását. Lásd: Lakeflow-folyamatláncok.
| Tulajdonság | Leírás |
|---|---|
| Folyamatok | Az áramlások adattovábbító csatornákban dolgozzák fel az adatokat. A flow API ugyanazt a DataFrame API-t használja, mint az Apache Spark és a Strukturált streamelés. Egy folyamat képes adatfolyam-táblákba és célokba írni, például egy Kafka témába, adatfolyam-szemantika használatával, vagy anyagi nézetbe írni kötegelt szemantika alkalmazásával. |
| adatfolyam táblák | A streamelési táblázat egy Delta-tábla, amely további támogatást nyújt a streameléshez vagy a növekményes adatfeldolgozáshoz. Egy vagy több adatfolyam célpontjaként szolgál a munkafolyamatokban. |
| Materializált nézetek | A materializált nézet olyan nézet, amely gyorsítótárazott eredményeket biztosít a gyorsabb hozzáférés érdekében. A materializált nézet az adatcsatornák célpontjaként szolgál. |
| Mosogatók | A pipeline-ok célként támogatják a külső adatforrásokat. Ezek a fogadók olyan eseménystreamelési szolgáltatásokat tartalmazhatnak, mint az Apache Kafka vagy az Azure Event Hubs, a Unity Catalog által felügyelt külső táblák vagy a Pythonban definiált egyéni fogadók. |
Lakeflow tervező
A Lakeflow Designer egy vizuális adatelőkészítő eszköz a Azure Databricks. Átalakítási munkafolyamatokat hozhat létre és fedezhet fel egy fogd és vidd vászon vagy természetes nyelvi utasítások használatával. Minden tervezői munkafolyamatot a Unity Catalog által felügyelt, éles üzemre kész kód támogat. Lásd: Lakeflow Designer.
| Tulajdonság | Leírás |
|---|---|
| Vizualizációs adatok előkészítése | Adatátalakítási munkafolyamatokat hozhat létre egy fogd és vidd vásznon. |
| Adatok betöltése | Az Azure Databricks keresztül elérhető adatokat a Lakeflow Designer vizuális adatelőkészítőjében hozhatja létre. |
| Beépített operátorok | Beépített operátorok használata az adatok szűréséhez, összesítéséhez, összekapcsolásához és átalakításához. |
| Frissítések természetes nyelv használatával | Átalakítások létrehozása vagy frissítése természetes nyelvi kérésekkel a Genie Code-ban. |
Lakeflow-állások
A Lakeflow Jobs megbízható vezénylést és éles monitorozást biztosít minden adat- és AI-számítási feladathoz. Egy munka egy vagy több feladatból állhat, amelyek notebookokat, adatfolyamokat, kezelt csatlakozókat, SQL lekérdezéseket, gépi tanulási képzést, és modell üzembe helyezést és következtetést futtatnak. A Jobs támogatja az egyedi vezérlési folyamatok logikáját, például az ágaztatást if / else utasításokkal, valamint a ciklusokat for each utasításokkal. Lásd Lakeflow Jobs.
| Tulajdonság | Leírás |
|---|---|
| Munkahelyek | A munkák az orchestráció elsődleges erőforrásai. Ezek olyan folyamatot jelölnek, amelyet ütemezetten szeretne végrehajtani. |
| Feladatok | Egy adott feladaton belüli munkaegység. Számos feladattípus létezik, amelyek számos lehetőséget biztosítanak, amelyek elvégezhetők egy feladaton belül. |
| Feladatok vezérlési folyamata | A folyamatvezérlési feladatok segítségével szabályozhatja, hogy más tevékenységeket vagy a futtatandó tevékenységek sorrendjét futtatja-e. |
Databricks futtatói környezet az Apache Spark-hoz
A Databricks Runtime egy megbízható és teljesítményoptimalizált számítási környezet Spark-számítási feladatok futtatásához, beleértve a kötegeket és a streamelést is. A Databricks Runtime biztosítja a Photont, egy magas teljesítményű, Databricks-native vektorizált lekérdezőmotort, valamint különféle infrastruktúra-optimalizálásokat, mint például az automatikus skálázás. A Databricks Runtime-on futtathatja a Spark és a Structured Streaming feladatokat azáltal, hogy Spark programjait notebookokként, JAR-fájlokként vagy Python kerekekként (wheels) építi fel. Lásd: Databricks Runtime for Apache Spark.
| Tulajdonság | Leírás |
|---|---|
| Apache Spark a Databricksen | A Spark a Databricks Data + AI platform középpontjában áll. |
| Strukturált streamelés | A strukturált streamelés a Spark közel valós idejű feldolgozási motorja az adatok streameléshez. |
Mi történt a Delta Live Tables (DLT) szolgáltatással?
Ha ismeri a Delta Live Tables (DLT) tábláit, olvassa el a Mi történt a Delta Live Tables (DLT) szolgáltatással?
További erőforrások
- A Data engineering concepts leírja a data engineering koncepciókat az Azure Databricks-ben.
- A Delta Lake egy optimalizált tárhelyréteg, amely alapot biztosít a táblázatok számára a lakehouse-ban az Azure Databricksben.
- Adatelemzési legjobb gyakorlatok megismertetnek az Azure Databricks adatmérnöki legjobb gyakorlataival.
- A Databricks jegyzetfüzetek népszerű eszközök az együttműködéshez és fejlesztéshez.
- Databricks SQL SQL lekérdezések és BI eszközök használatát írja le az Azure Databricks környezetben.
- Gépi tanulás az Azure Databricksben a gépi tanulási megoldások tervezését ismerteti.