Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
Feljegyzés
A cikk szervezete feltételezi, hogy az egyszerű űrlap számítási felhasználói felületét használja. Az egyszerű űrlap módosításainak áttekintéséért lásd: Az egyszerű űrlap használatával kezelje a számítási feladatokat.
Ez a cikk az új teljes célú vagy feladat-számítási erőforrás létrehozásakor elérhető konfigurációs beállításokat ismerteti. A felhasználók többsége a hozzárendelt szabályzatok használatával hoz létre számítási erőforrásokat, ami korlátozza a konfigurálható beállításokat. Ha nem lát egy adott beállítást a felhasználói felületen, az azért van, mert a kiválasztott szabályzat nem teszi lehetővé a beállítás konfigurálását.
A számítási feladatok konfigurálásával kapcsolatos javaslatokért tekintse meg a klasszikus számítási konfiguráció ajánlott eljárásait.
A cikkben ismertetett konfigurációk és felügyeleti eszközök mind a teljes körű, mind a feladatalapú számításra érvényesek. A feladat-számítás konfigurálásával kapcsolatos további szempontokért lásd : Számítási feladatok számításának konfigurálása.
Új, teljes körű számítási erőforrás létrehozása
Új, teljes célú számítási erőforrás létrehozása:
- A munkaterület oldalsávjában kattintson a Számítás gombra.
- Kattintson a Számítás létrehozása gombra.
- Konfigurálja a számítási erőforrást.
- Kattintson a gombralétrehozásához.
Az új számítási erőforrás automatikusan elindul, és hamarosan használatra kész lesz.
számítási szabályzat
A szabályzatok olyan szabályok, amelyek a számítási erőforrások létrehozásakor a felhasználók számára elérhető konfigurációs beállítások korlátozására szolgálnak. Ha egy felhasználó nem rendelkezik a korlátlan fürtlétrehozás jogosultságával, akkor csak a megadott szabályzatok használatával hozhat létre számítási erőforrásokat.
Ha szabályzat szerint szeretne számítási erőforrásokat létrehozni, válasszon egy szabályzatot a Házirend legördülő menüből.
Alapértelmezés szerint minden felhasználó rendelkezik hozzáféréssel a személyes számítási szabályzathoz, amely lehetővé teszi számukra az egygépes számítási erőforrások létrehozását. Ha hozzá kell férnie a Személyes számításhoz vagy bármilyen további szabályzathoz, forduljon a munkaterület rendszergazdájához.
Teljesítménybeállítások
Az alábbi beállítások az egyszerű űrlap számítási felhasználói felületének Teljesítmény szakaszában jelennek meg:
- Databricks Runtime-verziók
- Foton gyorsítás használata
- feldolgozó csomóponttípus
- egyszerű csomópontú számítási erőforrás
- Automatikus skálázás engedélyezése
- Speciális teljesítménybeállítások
Databricks-Runtime-verziók
A Databricks Runtime a számításon futó alapvető összetevők halmaza. Válassza ki a futtatókörnyezetet a Databricks Runtime Version legördülő menüben. A Databricks Runtime egyes verzióival kapcsolatos részletekért lásd a Databricks Runtime kibocsátási megjegyzéseinek verzióit és kompatibilitását. Minden verzió tartalmazza az Apache Sparkot. A Databricks a következőket javasolja:
- A teljes körű számításhoz használja a legújabb verziót, hogy biztosítsa a legújabb optimalizálást és a kód és az előre betöltött csomagok közötti legújabb kompatibilitást.
- Az operatív számítási feladatokat futtató feladatokhoz érdemes lehet a Databricks Futtatókörnyezet hosszú távú támogatási (LTS) verzióját használni. Az LTS-verzió használata biztosítja, hogy ne fusson kompatibilitási problémákba, és a frissítés előtt alaposan tesztelje a számítási feladatokat.
- Adatelemzési és gépi tanulási használati esetek esetén fontolja meg a Databricks Runtime ML-verziót.
Photon-gyorsítás használata
A Photon alapértelmezés szerint engedélyezve van a Databricks Runtime 9.1 LTS-t vagy újabb verziót futtató számításnál.
A fotongyorsítás engedélyezéséhez vagy letiltásához jelölje be a Foton-gyorsítás használata jelölőnégyzetet. A Photonről további információt a Mi a Photon? című témakörben talál.
munkavégző csomópont típus
A számítási erőforrás egy illesztőcsomópontból és nulla vagy több feldolgozó csomópontból áll. Az illesztőprogram- és feldolgozócsomópontokhoz külön felhőszolgáltatói példánytípusokat választhat, de alapértelmezés szerint az illesztőprogram-csomópont ugyanazt a példánytípust használja, mint a feldolgozó csomópont. A vezérlő csomópont beállítása a Speciális teljesítmény szakasz alatt található.
A példánytípusok különböző családjai különböző használati esetekhez passzolnak, például memóriaigényes vagy számítás-intenzív feladatokhoz. Kiválaszthat egy erőforrás poolt, amelyet munkavégző vagy vezérlőcsomópontként szeretne használni.
Fontos
Ne használjon olyan készletet, amely spot példányokkal rendelkezik illesztőprogram típusként. Válasszon egy kérésre elérhető illesztőprogramtípust, hogy megakadályozza az illesztőprogram visszavonását. Lásd Csatlakozás medencékhez.
A többcsomópontos számításban a feldolgozó csomópontok futtatják a Spark-végrehajtókat és a megfelelően működő számítási erőforráshoz szükséges egyéb szolgáltatásokat. Ha a Sparkkal osztja el a számítási feladatokat, az elosztott feldolgozás teljes egészében a munkavégző csomópontokon történik. Azure Databricks feldolgozó csomópontonként egy végrehajtót futtat. Ezért a végrehajtó és a feldolgozó kifejezések felcserélhetők a Databricks-architektúra kontextusában.
Tipp.
Spark-feladat futtatásához legalább egy munkavégző csomópontra van szükség. Ha a számítási erőforrás nulla feldolgozóval rendelkezik, futtathat nem Spark-parancsokat az illesztőprogram-csomóponton, de a Spark-parancsok sikertelenek lesznek.
Rugalmas csomóponttípusok
Ha a munkaterületen engedélyezve vannak a rugalmas csomóponttípusok, rugalmas csomóponttípusokat használhat a számítási erőforráshoz. A rugalmas csomóponttípusok lehetővé teszik a számítási erőforrás alternatív, kompatibilis példánytípusokra való visszalépését, ha a megadott példánytípus nem érhető el. Ez a viselkedés javítja a számítási indítás megbízhatóságát azáltal, hogy csökkenti a kapacitáshibákat a számítási indítások során. Lásd: A számítási indítás megbízhatóságának javítása rugalmas csomóponttípusok használatával.
Feldolgozó csomópont IP-címei
Azure Databricks két privát IP-címmel rendelkező feldolgozó csomópontokat indít el. A csomópont elsődleges privát IP-címe kezeli az Azure Databricks belső forgalmát. A másodlagos privát IP-címet a Spark-tároló használja a fürtön belüli kommunikációhoz. Ez a modell lehetővé teszi, hogy Azure Databricks elkülönítést biztosítson több számítási erőforrás között ugyanabban a munkaterületen.
GPU-példánytípusok
A nagy teljesítményt igénylő számítási feladatokhoz, például a mélytanuláshoz kapcsolódó feladatok esetében Azure Databricks támogatja a grafikus feldolgozási egységek (GPU-k) által felgyorsított számítási erőforrásokat. További információ: GPU-kompatibilis számítás.
Azure bizalmas számítási szolgáltatások virtuális gépei
Azure bizalmas számítási virtuálisgép-típusok megakadályozzák az adatokhoz való jogosulatlan hozzáférést használat közben, beleértve a felhőszolgáltatót is. Ez a virtuálisgép-típus előnyös a szigorúan szabályozott iparágak és régiók, valamint a felhőben bizalmas adatokkal rendelkező vállalkozások számára. További információ Azure bizalmas számítástechnikáról: Azure bizalmas számítástechnika.
Ha Azure bizalmas számítási virtuális gépek használatával szeretné futtatni a számítási feladatokat, válassza ki a DC vagy EC sorozatú virtuális gépek típusait a feldolgozó és az illesztőprogram csomópont legördülő listájában. Lásd: Azure Bizalmas virtuális gépek beállításai.
egycsomópontos számítás
Az egycsomópontos jelölőnégyzet lehetővé teszi egyetlen csomópont számítási erőforrás létrehozását.
Az egycsomópontos számítás olyan feladatokhoz készült, amelyek kis mennyiségű adatot vagy nem elosztott számítási feladatot, például egycsomópontos gépi tanulási kódtárakat használnak. A többcsomópontos számítást elosztott számítási feladatokkal rendelkező nagyobb feladatokhoz kell használni.
Egycsomópont tulajdonságai
Egyetlen csomópont számítási erőforrása a következő tulajdonságokkal rendelkezik:
- Helyileg futtatja a Sparkot.
- A meghajtó gazdaként és dolgozóként is működik, munkavégző csomópontok nélkül.
- Logikai magonként egy végrehajtószálat hoz ki a számítási erőforrásban, mínusz 1 magot az illesztőprogramhoz.
- Menti az összes
stderr,stdout, éslog4jnaplókimenetet az illesztőprogram-naplóban. - Nem konvertálható többcsomópontos számítási erőforrássá.
Egy vagy több csomópont kijelölése
Fontolja meg a használati esetet az egy- vagy többcsomópontos számítás kiválasztásakor:
A nagy léptékű adatfeldolgozás kimeríti az erőforrásokat egyetlen csomópont számítási erőforrásán. Ezekhez a számítási feladatokhoz a Databricks többcsomópontos számítás használatát javasolja.
A többcsomópontos számítási erőforrás nem skálázható 0 feldolgozóra. Használjon inkább egycsomópontos számítást.
A GPU-ütemezés nincs engedélyezve egyetlen csomópontos számításban.
Egycsomópontos számításkor a Spark nem tudja olvasni az UDT oszlopot tartalmazó Parquet-fájlokat. A következő hibaüzenet eredménye:
The Spark driver has stopped unexpectedly and is restarting. Your notebook will be automatically reattached.A probléma megoldásához tiltsa le a natív Parquet-olvasót:
spark.conf.set("spark.databricks.io.parquet.nativeReader.enabled", False)
Automatikus skálázás engedélyezése
Ha az automatikus skálázás engedélyezése be van jelölve, megadhat egy minimális és maximális számú feldolgozót a számítási erőforráshoz. A Databricks ezután kiválasztja a feladat futtatásához szükséges feldolgozók számát.
A számítási erőforrás által automatikusan skálázandó feldolgozók minimális és maximális számának beállításához használja a Minimális és Maximális mezőket a Feldolgozó típusa legördülő lista mellett.
Ha nem engedélyezi az automatikus skálázást, meg kell adnia egy fix számú munkavégzőt a Feldolgozó típus legördülő menü melletti Munkavégzők mezőben.
Feljegyzés
Amikor a számítási erőforrás fut, a számítási részletek lapja megjeleníti a rendelkezésre álló dolgozók számát. Összehasonlíthatja a kiosztott munkások számát a munkáskonfigurációval, és szükség esetén módosíthatja azt.
Az automatikus skálázás előnyei
Az automatikus skálázással Azure Databricks dinamikusan átcsoportosítja a dolgozókat, hogy figyelembe vegyék a feladat jellemzőit. Előfordulhat, hogy a folyamat bizonyos részei számításilag nagyobb terhelést igényelnek, mint mások, és a Databricks automatikusan további feldolgozókat ad hozzá a feladat ezen fázisai során (és eltávolítja őket, ha már nincs rájuk szükség).
Az automatikus skálázás megkönnyíti a magas kihasználtság elérését, mivel nem kell erőforrásokat elrendeznie a terheléshez igazodva. Ez különösen azokra a számítási feladatokra vonatkozik, amelyek követelményei idővel változnak (például egy adathalmaz felfedezése egy nap során), de olyan egyszeri, rövidebb számítási feladatokra is alkalmazható, amelyek kiépítési követelményei ismeretlenek. Az automatikus skálázás így két előnyt kínál:
- A számítási feladatok gyorsabban futhatnak egy állandó méretű, nem kiépített számítási erőforráshoz képest.
- Az automatikus skálázás csökkentheti az általános költségeket egy statikus méretű számítási erőforráshoz képest.
A számítási erőforrás és a számítási feladat állandó méretétől függően az automatikus skálázás egyszerre nyújt egy vagy mindkét előnyt. A számítási méret alacsonyabb lehet a felhőszolgáltató által kiválasztott minimális számú munkásnál, ha a felhőszolgáltató leállítja a példányokat. Ebben az esetben az Azure Databricks folyamatosan újrapróbálkozik a példányok újraallokálásával a minimális munkavállalói szám fenntartása érdekében.
Feljegyzés
Az automatikus skálázás nem érhető el spark-submit feladatokhoz.
Feljegyzés
A számítási teljesítmény automatikus skálázása korlátozott a strukturált streamelési munkaterhelések esetében a fürtméret csökkentésében. A Databricks a Lakeflowban elérhető, továbbfejlesztett automatikus skálázással rendelkező Spark deklaratív adatfeldolgozási folyamatait ajánlja streaming számítási feladatokhoz. Lásd: A Lakeflow-folyamat fürtkihasználtságának optimalizálása automatikus skálázással.
Az automatikus skálázás viselkedése
A Prémium csomag munkaterülete optimalizált automatikus skálázást használ. A standard tarifacsomag munkaterületei szabványos automatikus skálázást használnak.
Az optimalizált automatikus skálázás a következő jellemzőkkel rendelkezik:
- Legfeljebb 2 skálázási eseményben skálázható fel minimálisról maximumra.
- Leskálázható, még akkor is, ha a számítási erőforrás nem tétlen, a shuffle fájl állapotának vizsgálata révén.
- Az aktuális csomópontok százalékos aránya alapján lefelé skálázható.
- A számítási feladat során csökkenthető a kapacitás, ha az elmúlt 40 másodpercben nem volt teljesen kihasználva az erőforrás.
- Átfogó számítási feladatok esetén lecsökkentjük a számítási erőforrást, ha az kihasználatlan az elmúlt 150 másodpercben.
- A
spark.databricks.aggressiveWindowDownSSpark konfigurációs tulajdonság másodpercek alatt megadja, hogy a számítás milyen gyakran hoz leskálázási döntéseket. Az érték növelésével a számítás lassabban skálázható le. A maximális érték 600.
Standard automatikus skálázást használnak a standardcsomag munkaterületeken. A standard automatikus skálázás a következő jellemzőkkel rendelkezik:
- Első lépésként adjon hozzá 8 csomópontot. Ezután exponenciálisan felskáláz, és a maximális érték eléréséhez annyi lépést tesz meg, amennyi szükséges.
- Amikor a csomópontok 90%-a nem foglalt 10 percig, és a számítás legalább 30 másodpercig tétlen, a rendszer leskálázza magát.
- Exponenciálisan lefelé skáláz, 1 csomóponttal kezdve.
Figyelmeztetés
Ne engedélyezze az Apache Spark dinamikus lefoglalását (spark.dynamicAllocation.enabled) a Databricks automatikus skálázást használó számítási erőforrásokon. A Databricks automatikus skálázása platformszinten kezeli a feldolgozó csomópontokat és a végrehajtói életciklust. A Spark dinamikus allokációjának egyidejű engedélyezése ütköző skálázási döntéseket okozhat, ami felesleges végrehajtók cserélődéséhez, NODES_LOST hibákhoz és olyan feladatokhoz vezethet, amelyeket soha nem hajtanak végre.
Automatikus skálázás erőforráskészletekkel
Ha a számítási erőforrást egy készlethez csatolja, vegye figyelembe a következőket:
- Győződjön meg arról, hogy a kért számítási teljesítmény kisebb vagy egyenlő, mint a készletben lévő tétlen példányok minimális mennyisége. Ha nagyobb, a számítási indítási idő egyenértékű lesz a készletet nem használó számítással.
- Győződjön meg arról, hogy a maximális számítási méret kisebb vagy egyenlő a készlet maximális kapacitásával . Ha nagyobb, a számítás létrehozása sikertelen lesz.
Automatikus skálázási példa
Ha újrakonfigurál egy statikus számítási erőforrást automatikus skálázásra, Azure Databricks azonnal átméretezi a számítási erőforrást a minimális és maximális korlátokon belül, majd elkezdi az automatikus skálázást. Az alábbi táblázat például bemutatja, hogy mi történik egy bizonyos kezdeti méretű számítási erőforrással, ha újrakonfigurálja a számítási erőforrást 5 és 10 csomópont közötti automatikus skálázásra.
| Kezdeti méret | Újrakonfigurálás utáni méret |
|---|---|
| 6 | 6 |
| 12 | 10 |
| 3 | 5 |
Speciális teljesítménybeállítások
Az alábbi beállítás a Speciális teljesítmény szakaszban jelenik meg az egyszerű űrlap számítási felhasználói felületén.
Spot példányok
A költségek megtakarításához választhatja a spot példányokat, más néven Azure Spot virtuális gépeket a Spot-példányok jelölőnégyzet bejelölésével.
Az első példány mindig igény szerinti lesz (a vezető csomópont mindig igény szerint működik), a későbbi példányok pedig időleges példányok lesznek.
Ha a példányok elérhetetlenség miatt elvételre kerülnek, az Azure Databricks megpróbál új "spot" példányokat kérni a kidobott példányok leváltásához. Ha az előre nem kötött példányok nem szerezhetők be, a rendszer igény szerinti példányokat helyez üzembe a kilakoltatott példányok helyére. Az igény szerinti visszaállítás csak a teljes mértékben beszerzett és futó spot példányok esetében támogatott. A telepítéskor sikertelen példányok nem lesznek automatikusan kicserélve.
Emellett, ha új csomópontokat adnak hozzá a meglévő számítási erőforrásokhoz, az Azure Databricks megpróbálja spot példányokat beszerezni azokhoz a csomópontokhoz.
Automatikus leállítás
A számítás automatikus leállítását a számítási űrlap létrehozása teljesítmény szakaszában állíthatja be. A számítás létrehozása során adjon meg percek alatt egy inaktivitási időszakot, amely után le szeretné állítani a számítási erőforrást.
Ha a számítási erőforráson az aktuális idő és az utolsó parancs futtatása közötti különbség nagyobb, mint a megadott inaktivitási időszak, Azure Databricks automatikusan leállítja a számítási erőforrást. A számítási leállításról további információt a számítás leállítása című témakörben talál.
Illesztőprogram típusa
Az illesztőprogram típusát a Speciális teljesítmény szakaszban választhatja ki. Az illesztőprogram-csomópont fenntartja a számítási erőforráshoz csatolt összes jegyzetfüzet állapotadatait. Az illesztőprogram-csomópont emellett fenntartja a SparkContextet, értelmezi a számítási erőforrás jegyzetfüzetéből vagy tárából futtatott összes parancsot, és futtatja a Spark-végrehajtókkal koordinált Apache Spark-főkiszolgálót.
Az illesztőcsomópont típusának alapértelmezett értéke megegyezik a munkavégző csomópont típusáéval. Nagyobb, több memóriával rendelkező illesztőprogram-csomóponttípust is választhat, ha a Spark-feldolgozóktól származó adatok nagy részét tervezi elemezni collect() a jegyzetfüzetben.
Tipp.
Mivel az illesztőprogram-csomópont megőrzi a csatolt jegyzetfüzetek összes állapotinformációját, mindenképpen válassza le a nem használt jegyzetfüzeteket az illesztőprogram-csomópontról.
Címkék
A címkék lehetővé teszik a szervezet különböző csoportjai által használt számítási erőforrások költségeinek egyszerű monitorozását. Adja meg a címkéket kulcs-érték párként a számítás létrehozásakor, és Azure Databricks ezeket a címkéket a felhőbeli erőforrásokra, például virtuális gépekre és lemezkötetekre, valamint a Databricks használati naplóira alkalmazza.
Készletekből indított számítás esetén az egyéni címkék csak a DBU használati jelentéseire lesznek alkalmazva, és nem propagálódnak a felhőbeli erőforrásokra.
A készlet- és számításicímke-típusok együttes működéséről további információt a Címkék használata attribútumokkal és a használat nyomon követésével című témakörben talál.
Címkék hozzáadása a számítási erőforráshoz:
- A Címkék szakaszban adjon hozzá egy kulcs-érték párot az egyes egyéni címkékhez.
- Kattintson a Hozzáadás gombra.
Speciális beállítások
Az alábbi beállítások az egyszerű űrlap számítási felhasználói felületének Speciális szakaszában jelennek meg:
- Hozzáférési módok
- Helyi tároló automatikus skálázásának engedélyezése
- helyi lemeztitkosítás
- Spark-konfiguráció
- Számítási naplók kézbesítése
- SSH-hozzáférés a számítási erőforráshoz
- környezeti változók
Hozzáférési módok
A hozzáférési mód egy biztonsági funkció, amely meghatározza, hogy ki használhatja a számítási erőforrást, és milyen adatokhoz férhet hozzá annak segítségével. A Azure Databricks összes számítási erőforrása rendelkezik hozzáférési móddal. A hozzáférési mód beállításai az egyszerű űrlap számítási felhasználói felületének Speciális szakaszában találhatók.
A hozzáférési mód kiválasztása alapértelmezés szerint Automatikus, ami azt jelenti, hogy a rendszer automatikusan kiválasztja a hozzáférési módot a kiválasztott Databricks-futtatókörnyezet alapján. Az Auto alapértelmezés szerint a Standard értéket használja, kivéve, ha gépi tanulási futtatókörnyezet, GPU-példánytípus vagy 14.3-nál alacsonyabb verziójú Databricks Runtime van kiválasztva, amely esetben a Dedikált érték lesz használva.
A Databricks azt javasolja, hogy standard hozzáférési módot használjon, kivéve, ha a szükséges funkciók nem támogatottak.
| Hozzáférési mód | Description | Támogatott nyelvek |
|---|---|---|
| Standard | Több felhasználó is használhatja a felhasználók közötti adatelkülönítéssel. | Python, SQL, Scala |
| dedikált | Egyetlen felhasználóhoz vagy csoporthoz rendelhető hozzá és használhatja. | Python, SQL, Scala, R |
Az egyes hozzáférési módok funkciótámogatásával kapcsolatos részletes információkért tekintse meg a standard számítási követelményeket és korlátozásokat , valamint a dedikált számítási követelményeket és korlátozásokat.
Feljegyzés
A Databricks Runtime 13.3 LTS-ben és újabb verziókban az init szkripteket és kódtárakat minden hozzáférési mód támogatja. A követelmények és a támogatási szintek eltérőek. Lásd Hol telepíthetők init szkriptek? és számítási hatókörű kódtárak.
Helyi tároló automatikus skálázásának engedélyezése
Gyakran nehéz megbecsülni, hogy egy adott feladat mennyi lemezterületet fog igénybe venni. Annak érdekében, hogy ne kelljen megbecsülnie, hogy a létrehozáskor hány gigabájtnyi felügyelt lemezt csatoljon a számításhoz, Azure Databricks automatikusan engedélyezi a helyi tároló automatikus skálázását az összes Azure Databricks számításon.
A helyi tároló automatikus skálázásával Azure Databricks figyeli a számítási Spark-feldolgozókon rendelkezésre álló szabad lemezterület mennyiségét. Ha egy feldolgozó túl alacsonyan kezd futni a lemezen, a Databricks automatikusan csatol egy új felügyelt lemezt a feldolgozóhoz, mielőtt elfogyna a lemezterület. A virtuális gépeken a lemezekkel együtt legfeljebb 5 TB összes lemezterületet lehet csatolni (beleértve a virtuális gép kezdeti helyi tárolását is).
A virtuális géphez csatlakoztatott felügyelt lemezek csak akkor lesznek leválasztva, ha a virtuális gép visszakerül az Azure-ba. Ez azt jelzi, hogy a felügyelt lemezek soha nem lesznek leválasztva a virtuális gépekről, amíg egy futó számítás részét képezik. A felügyelt lemezek használatának leskálázásához Azure Databricks azt javasolja, hogy ezt a funkciót a autoscaling compute vagy automatikus leállítás konfigurált számításban használja.
Helyi lemeztitkosítás
Fontos
Ez a funkció a nyilvános előzetes verzióban érhető el.
A számítás futtatásához használt példánytípusok némelyike helyileg csatlakoztatott lemezekkel rendelkezhet. Azure Databricks tárolhatja a helyileg csatlakoztatott lemezeken a shuffle vagy a rövid élettartamú adatokat. Annak érdekében, hogy minden inaktív adat titkosítva legyen minden tárolási típushoz, beleértve az ideiglenesen a számítási erőforrás helyi lemezén tárolt shuffle adatokat is, engedélyezheti a helyi lemeztitkosítást.
Fontos
A számítási feladatok lassabban futhatnak a teljesítményre gyakorolt hatás miatt, amit a titkosított adatok helyi kötetekbe történő olvasása és írása okoz.
Ha a helyi lemeztitkosítás engedélyezve van, Azure Databricks helyileg létrehoz egy olyan titkosítási kulcsot, amely egyedi az egyes számítási csomópontokon, és a helyi lemezeken tárolt összes adat titkosítására szolgál. A kulcs hatóköre minden számítási csomóponton helyi, és a számítási csomóponttal együtt megsemmisül. A kulcs az élettartama során a memóriában található a titkosításhoz és a visszafejtéshez, és titkosítva tárolja a lemezen.
A helyi lemeztitkosítás engedélyezéséhez a Clusters API-t kell használnia. A számítás létrehozása vagy szerkesztése során állítsa enable_local_disk_encryptiontrueértékre.
Spark-konfiguráció
A Spark-feladatok finomhangolásához egyéni Spark-konfigurációs tulajdonságokat is megadhat.
Feljegyzés
A Databricks Runtime 19 és újabb verziók standard hozzáférési módban bizonyos Spark-konfigurációs tulajdonságok korlátozottak. A korlátozott tulajdonságot beállító fürt létrehozása vagy szerkesztése hiba miatt meghiúsul. Lásd a Spark konfigurációs korlátait.
A számítási konfigurációs lapon kattintson a Speciális kapcsolóra.
Kattintson a Spark fülre.
A Spark-konfigurációban soronként egy kulcs-érték párként adja meg a konfigurációs tulajdonságokat.
Ha számítást a fürtök API-ja használatával konfigurálja, állítsa be a Spark tulajdonságokat a spark_conf mezőben a fürt létrehozási API vagy a fürt frissítési API használatakor.
A Spark-konfigurációk számítási kényszerítéséhez a munkaterület rendszergazdái számítási szabályzatokat használhatnak.
Spark-konfigurációs tulajdonság lekérése titkos kódból
A Databricks azt javasolja, hogy az egyszerű szöveg helyett titkos kódban tárolja a bizalmas információkat, például a jelszavakat. Ha egy titkos kódra szeretne hivatkozni a Spark-konfigurációban, használja a következő szintaxist:
spark.<property-name> {{secrets/<scope-name>/<secret-name>}}
Ha például egy password nevű Spark-konfigurációs tulajdonságot szeretne beállítani a secrets/acme_app/passwordtárolt titkos kód értékére:
spark.password {{secrets/acme-app/password}}
További információ: Titkos kódok kezelése.
Számítási naplók kézbesítése
A teljes célú vagy feladatalapú számítás létrehozásakor megadhatja a fürtnaplók helyét, beleértve a Spark-illesztő naplóit, a feldolgozó csomópontokat és az eseményeket. A naplók öt percenként érkeznek, és óránként archiválódnak a kiválasztott célhelyen. A Databricks a számítási erőforrás leállításáig folytatja a naplók kézbesítését.
A naplókat az alábbi helyek egyikén tárolhatja:
- Kötetek (ajánlott): A naplókat egy Unity-katalógus kötetútvonalán tárolja. Ez a unitykatalógus-kompatibilis számítási erőforrások használata esetén ajánlott és legbiztonságosabb megoldás.
- DBFS (örökölt): A naplókat a Databricks Fájlrendszer (DBFS) elérési útvonalán tárolja. Ez a beállítás csak akkor érhető el, ha a DBFS-gyökér és a csatlakoztatások nincsenek letiltva a munkaterületen. Tekintse meg a meglévő Azure Databricks munkaterületen található DBFS-gyökérhez és csatlakoztatásokhoz való hozzáférés letiltását.
A naplók kézbesítési helyének konfigurálása:
- A számítási lapon kattintson a Speciális kapcsolóra.
- Kattintson a Naplózás fülre.
- Válasszon egy céltípust.
- Adja meg a napló elérési útját.
A naplók tárolásához a Databricks létrehoz egy almappát a kiválasztott naplóútvonalon, amely a számítás cluster_idnevét viseli.
Ha például a megadott naplóútvonal /Volumes/catalog/schema/volume, a 06308418893214 naplói /Volumes/catalog/schema/volume/06308418893214lesznek kézbesítve.
Feljegyzés
A naplók kötetre történő kézbesítése csak a Unity Katalógus által támogatott, standard hozzáférési móddal vagy a felhasználóhoz rendelt dedikált hozzáférési móddal támogatott. Nem támogatott, ha dedikált hozzáférési mód van a csoporthoz rendelve. Ha kijelöl egy kötetet elérési útként, ellenőrizze, hogy a számítás tulajdonosa vagy a hozzá rendelt felhasználó rendelkezik-e a READ VOLUME kötetre vonatkozó engedélyekkel és WRITE VOLUME engedélyekkel. Tekintse meg a Unity Catalog-kötetek jogosultságait.
SSH-hozzáférés a számításhoz
Biztonsági okokból a Azure Databricks az SSH-port alapértelmezés szerint zárva van. Ha engedélyezni szeretné az SSH-hozzáférést a Spark-fürtökhöz, nézze meg az SSH-t a vezető csomóponthoz.
Feljegyzés
Az SSH csak akkor engedélyezhető, ha a munkaterület a saját Azure virtuális hálózatában van üzembe helyezve.
Környezeti változók
Konfigurálja a számítási erőforráson futó init-szkriptekből elérhető egyéni környezeti változókat . A Databricks előre definiált környezeti változókat is biztosít, amelyeket init-szkriptekben használhat. Ezeket az előre definiált környezeti változókat nem lehet felülbírálni.
Feljegyzés
A Databricks Runtime 19-es és újabb verzióiban standard hozzáférési módban csak előre definiált környezeti változók állnak rendelkezésre a Spark-motor és az init szkriptek számára. A fürtön beállított egyéb változók továbbra is elérhetők maradnak a felhasználói kód számára, beleértve az UDF-eket is. Lásd a környezeti változókra vonatkozó korlátozásokat.
A számítási konfigurációs lapon kattintson a Speciális gombra.
Kattintson a Spark fülre.
Állítsa be a környezeti változókat a Környezeti változók mezőben.
Környezeti változókat a spark_env_vars mező használatával a Fürt létrehozása API-ben vagy a Fürt frissítése API-ban is beállíthatja.