Előrejelzés az AutoML használatával (klasszikus számítás)

Az AutoML használatával automatikusan megkeresheti a legjobb előrejelzési algoritmust és hiperparaméter-konfigurációt az értékek előrejelzéséhez idősoradatok alapján.

Az idősor-előrejelzés csak a Databricks Runtime 10.0 ML-es vagy újabb verziójához érhető el.

Előrejelzési kísérlet beállítása a felhasználói felülettel

Az AutoML felhasználói felületén az alábbi lépésekkel állíthat be előrejelzési problémát:

  1. Az oldalsávon válassza a Kísérleteklehetőséget.
  2. Az Előrejelzés kártyán válassza a Betanítás indításalehetőséget.

Az előrejelzési felhasználói felület alapértelmezés szerint kiszolgáló nélkülielőrejelzés. Ha a saját számítási eszközével szeretné elérni az előrejelzést, válassza a gombot a régi élmény visszaállításához.

AutoML-kísérlet konfigurálása

  1. Megjelenik az AutoML-kísérlet konfigurálása lap . Ezen a lapon konfigurálja az AutoML-folyamatot, megadva az adathalmazt, a probléma típusát, a cél- vagy címkeoszlopot az előrejelzéshez, a metrikát a kísérletfuttatások kiértékeléséhez és pontszámához, valamint a feltételek leállításához.

  2. A Számítási mezőben jelöljön ki egy Databricks Runtime 10.0 ML vagy annál újabb verziót futtató fürtöt.

  3. Az Adatkészlet csoportban kattintson a Tallózás gombra. Lépjen a használni kívánt táblázatra, és kattintson a Kijelölés parancsra. Megjelenik a táblaséma.

  4. Kattintson az Előrejelzés célmezőre . Megjelenik egy legördülő menü, amely felsorolja a sémában látható oszlopokat. Jelölje ki azt az oszlopot, amelyet a modell előre jelez.

  5. Kattintson az Idő oszlop mezőre. Megjelenik egy legördülő lista, amely a timestamp vagy datetípusú adathalmazoszlopokat jeleníti meg. Jelölje ki az idősorok időszakait tartalmazó oszlopot.

  6. Többsoros előrejelzéshez válassza ki azokat az oszlop(ok)t, amelyek azonosítják az egyes idősorokat az Idősor-azonosítók legördülő listából. Az AutoML ezeket az oszlopokat különböző idősorokként csoportosítja, és egymástól függetlenül tanít be modelleket az egyes adatsorokhoz. Ha ezt a mezőt üresen hagyja, az AutoML feltételezi, hogy az adathalmaz egyetlen idősort tartalmaz.

  7. Az Előrejelzési horizont és gyakoriság mezőkben adja meg azoknak az időszakoknak a számát, amelyekre az AutoML-nek ki kell számítania az előrejelzett értékeket. A bal oldali mezőbe írja be az előrejelezendő időszakok egész számát. A jobb oldali mezőben válassza ki az egységeket.

    Feljegyzés

    Az Auto-ARIMA használatához az idősornak rendszeres gyakorisággal kell rendelkeznie, ahol a két pont közötti intervallumnak az idősor során azonosnak kell lennie. A gyakoriságnak meg kell egyeznie az API-hívásban vagy az AutoML felhasználói felületén megadott frekvenciaegységtel. Az AutoML úgy kezeli a hiányzó időlépéseket, hogy az előző értékkel kitölti ezeket az értékeket.

  8. A Databricks Runtime 11.3 LTS ML-ben és újabb verziókban mentheti az előrejelzési eredményeket. Ehhez adjon meg egy adatbázist a Kimeneti adatbázis mezőben. Kattintson a Tallózás elemre, és válasszon ki egy adatbázist a párbeszédablakban. Az AutoML az előrejelzési eredményeket az adatbázis egyik táblájának írja.

  9. A Kísérletnév mező az alapértelmezett nevet jeleníti meg. A módosításhoz írja be az új nevet a mezőbe.

További lehetőségek:

Speciális konfigurációk

A paraméterek eléréséhez nyissa meg a Speciális konfiguráció (nem kötelező) szakaszt.

  • A kiértékelési metrika a futtatások pontszámának elsődleges mérőszáma .
  • A Databricks Runtime 10.4 LTS ML és újabb verziókban kizárhatja a betanítási keretrendszereket. Alapértelmezés szerint az AutoML az AutoML-algoritmusok alatt felsorolt keretrendszerek használatával képez be modelleket.
  • A leállítási feltételeket szerkesztheti. Az alapértelmezett leállítási feltételek a következők:
    • Az előrejelzési kísérletekhez 120 perc után állítsa le.
    • A Databricks Runtime 10.4 LTS ML-ben és alatta a besorolási és regressziós kísérletek esetében 60 perc elteltével vagy 200 próba elvégzése után állítsa le a műveletet, attól függően, hogy melyik az első. A Databricks Runtime 11.0 ML-es és újabb verziói esetében a kísérletek száma nem áll megállási feltételként.
    • A Databricks Runtime 10.4 LTS ML és újabb verziókban a besorolási és regressziós kísérletekhez az AutoML magában foglalja a korai leállást; leállítja a modellek betanítását és finomhangolását, ha az érvényesítési metrika már nem javul.
  • A Databricks Runtime 10.4 LTS ML és újabb verziókban kiválaszthat egy time column az adatok időrendi sorrendben történő felosztásához a tanítás, validálás és tesztelés céljából (csak a kategorizálás és a regresszióesetén érvényes).
  • A Databricks azt javasolja, hogy hagyja üresen az Adatkönyvtár mezőt. A mező feltöltésének tiltása az adathalmaz MLflow-összetevőként való biztonságos tárolásának alapértelmezett viselkedését váltja ki. Megadható dbFS-elérési út, de ebben az esetben az adathalmaz nem örökli az AutoML-kísérlet hozzáférési engedélyeit.

A kísérlet futtatása és az eredmények monitorozása

Az AutoML-kísérlet elindításához kattintson az AutoML indítása gombra. A kísérlet elindul, és megjelenik az AutoML betanítási oldala. A futtatás táblájának frissítéséhez kattintson a Frissítés gombra.

Kísérlet előrehaladásának megtekintése

Ezen az oldalon a következőket teheti:

  • Bármikor állítsa le a kísérletet.
  • Nyissa meg az adatfeltáró jegyzetfüzetet.
  • Monitorozási futtatások.
  • Lépjen a futtatáshoz tartozó oldalra bármelyik futtatás esetén.

A Databricks Runtime 10.1 ML-es vagy újabb verziójával az AutoML figyelmeztetéseket jelenít meg az adatkészlettel kapcsolatos lehetséges problémákra, például nem támogatott oszloptípusokra vagy magas számosságú oszlopokra.

Feljegyzés

A Databricks a lehető legjobban képes jelezni a lehetséges hibákat vagy problémákat. Előfordulhat azonban, hogy ez nem átfogó, és nem feltétlenül rögzíti a keresett problémákat vagy hibákat.

Az adathalmazra vonatkozó figyelmeztetések megtekintéséhez kattintson a betanítási lap Figyelmeztetések lapjára vagy a kísérletoldalra a kísérlet befejezése után.

AutoML-figyelmeztetések

Eredmények megtekintése

A kísérlet befejezése után a következőt teheti:

  • Regisztrálja és telepítse az egyik modellt az MLflow használatával.
  • Válassza A legjobb modell megtekintése lehetőséget a legjobb modellt létrehozó jegyzetfüzet áttekintéséhez és szerkesztéséhez.
  • Válassza Adatfeltárási jegyzetfüzet megtekintése lehetőséget az adatfeltárási jegyzetfüzet megnyitásához.
  • A futtatások táblázatában keresse meg, szűrje és rendezze a futtatásokat.
  • A futtatás részleteinek megtekintése:
    • A próbaverziós futtatáshoz forráskódot tartalmazó létrehozott jegyzetfüzet az MLflow-futtatásra való kattintással található. A jegyzetfüzet a futtatási lap Összetevők szakaszában lesz mentve. Letöltheti ezt a jegyzetfüzetet, és importálhatja a munkaterületre, ha a munkaterület rendszergazdái engedélyezik az összetevők letöltését.
    • A futtatási eredmények megtekintéséhez kattintson a Modellek oszlopra vagy a Kezdési idő oszlopra. Megjelenik a futtatási oldal, amely a próbafuttatással kapcsolatos információkat (például paramétereket, metrikákat és címkéket) és a futtatás által létrehozott összetevőket jeleníti meg, beleértve a modellt is. Ez a lap kódrészleteket is tartalmaz, amelyekkel előrejelzéseket készíthet a modellel.

Ha később vissza szeretne térni ehhez az AutoML-kísérlethez, keresse meg a Kísérletek laptáblázatában. Az egyes AutoML-kísérletek eredményei, beleértve az adatfeltárási és betanítási jegyzetfüzeteket, a databricks_automl mappában kerülnek tárolásra azon felhasználó home mappájában, aki futtatta a kísérletet.

Modell regisztrálása és üzembe helyezése

Regisztrálja és telepítse a modellt az AutoML felhasználói felületén. Amikor egy futtatás befejeződik, a felső sor az elsődleges metrika alapján a legjobb modellt jeleníti meg.

  1. Válassza ki a regisztrálni kívánt modell Modell oszlopában található hivatkozást.
  2. Válassza a Modell regisztrálása gombot a Unity Katalógusban vagy a Modellregisztrációs adatbázisban való regisztrációhoz.

    Feljegyzés

    A Databricks azt javasolja, hogy a legújabb funkciókhoz regisztráljon modelleket a Unity Catalogban.

  3. A regisztráció után üzembe helyezheti a modellt egy végpontot kiszolgáló egyéni modellben.

Nincs "pandas.core.indexes.numeric" nevű modul

Az AutoML és a Model Service használatával készült modellek kiszolgálásakor a következő hibaüzenet jelenhet meg: No module named 'pandas.core.indexes.numeric.

Ennek oka az AutoML és a végpontkörnyezetet kiszolgáló modell közötti nem kompatibilis pandas verzió. Ezt a hibát a add-pandas-dependency.py szkript futtatásával oldhatja meg. A szkript szerkeszti a requirements.txt és conda.yaml elemeket a naplózott modelljében, hogy tartalmazzák a megfelelő pandas függőségi verziót: pandas==1.5.3

  1. Módosítsa úgy a szkriptet, hogy tartalmazza annak a MLflow-futtatásnak a run_id azonosítóját, amelyben a modellt naplózták.
  2. Regisztrálja újra a modellt a Unity Catalogban vagy a modellregisztrációs adatbázisban.
  3. Próbálja meg kiszolgálni az MLflow-modell új verzióját.

Következő lépések