Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
Ez a cikk azt ismerteti, hogyan készíti elő az AutoML az adatokat az előrejelzési betanításhoz, és ismerteti a konfigurálható adatbeállításokat. Ezeket a beállításokat az AutoML felhasználói felületén a kísérlet beállítása során módosíthatja.
Ezeknek a beállításoknak az AutoML API-val történő konfigurálásához tekintse meg az AutoML Python API-referenciát.
Támogatott adatfunkció-típusok
Csak az alább felsorolt szolgáltatástípusok támogatottak. A képek például nem támogatottak.
A következő szolgáltatástípusok támogatottak:
- Numerikus (
ByteType,ShortType,IntegerType,LongType,FloatTypeésDoubleType) - logikai
- Sztring (kategorikus vagy angol szöveg)
- Időbélyegek (
TimestampType,DateType) - ArrayType[Numerikus] (Databricks Runtime 10.4 LTS ML és újabb)
- DecimalType (Databricks Runtime 11.3 LTS ML és újabb)
Hiányzó értékek pótlása
A Databricks Runtime 10.4 LTS ML és újabb verziókban megadhatja a null értékek imputálásának módját. A felhasználói felületen válasszon egy metódust a Impute legördülő listából, amelyben oszlop található a táblázat sémájában. Az API-ban használja a paramétert imputers . További információ: AutoML Python API-referencia.
Alapértelmezés szerint az AutoML kiválaszt egy számítási módszert az oszloptípus és a tartalom alapján.
Feljegyzés
Ha nem alapértelmezett számítási módszert ad meg, az AutoML nem végez szemantikai típusészlelést.
Előrejelzési adatok felosztása betanítási, érvényesítési és tesztelési csoportokra
Az AutoML három részre osztja az adatokat a betanításhoz, az ellenőrzéshez és a teszteléshez.
A tevékenységek előrejelzéséhez az AutoML idősorok keresztellenőrzését használja. Ez a módszer fokozatosan bővíti a betanítási adatkészletet időrendben, és érvényesítést végez a későbbi időpontokon. A keresztérvényesítés a modell teljesítményének robusztus kiértékelését teszi lehetővé különböző időszakaszokon keresztül. Biztosítja, hogy az előrejelzési modell szigorúan tesztelve legyen a nem látható jövőbeli adatokon, megőrizve az előrejelzések relevanciáját és pontosságát.
A keresztérvényesítési hajtások száma a bemeneti tábla olyan jellemzőitől függ, mint az idősorok száma, a kovariaátok jelenléte és az idősor hossza.
Idősorok összesítése
Az előrejelzési problémák esetén, ha egy idősorban több érték is szerepel az időbélyegben, az AutoML az értékek átlagát használja.
Az összeg használatához szerkessze a próbafuttatások által létrehozott forráskód-jegyzetfüzetet.
Az Adatok összesítése ... cellával az alábbi módon váltson a .agg(y=(target_col, "avg")) következőre.agg(y=(target_col, "sum")):
group_cols = [time_col] + id_cols
df_aggregation = df_loaded \
.groupby(group_cols) \
.agg(y=(target_col, "sum")) \
.reset_index() \
.rename(columns={ time_col : "ds" })