Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Usage
microsoftml.rx_featurize(data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
pandas.core.frame.DataFrame],
output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
str] = None, overwrite: bool = False,
data_threads: int = None, random_seed: int = None,
max_slots: int = 5000, ml_transforms: list = None,
ml_transform_vars: list = None, row_selection: str = None,
transforms: dict = None, transform_objects: dict = None,
transform_function: str = None,
transform_variables: list = None,
transform_packages: list = None,
transform_environment: dict = None, blocks_per_read: int = None,
report_progress: int = None, verbose: int = 1,
compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None)
Description
Převádí data ze vstupní datové sady na výstupní datovou sadu.
Arguments
data
Revoskalpický datový zdrojový objekt, datový rámec nebo cesta k souboru.xdf.
output_data
Výstup textu nebo xdf názvu souboru či RxDataSource s možností zápisu pro ukládání transformovaných dat. Pokud žádný, vrátí se datový rámec. Výchozí hodnota je None.
přepsat
Pokud True, existující output_data je přepsán; pokud False existující output_data není přepsáno. Výchozí hodnota je False.
data_threads
Celé číslo určující požadovaný stupeň paralelismu v datovém potrubí. Pokud žádné, počet použitých vláken je určen interně. Výchozí hodnota je None.
random_seed
Určuje náhodné počáteční. Výchozí hodnota je None.
max_slots
Maximální počet slotů pro vrácení pro sloupce s vektorovými hodnotami (<=0 pro vrácení všech).
ml_transforms
Určuje seznam transformací MicrosoftML, které se mají provést s daty před trénováním nebo Žádná , pokud se neprovedou žádné transformace. Viz featurize_text, categoricala categorical_hash, pro transformace, které jsou podporovány.
Tyto transformace se provádějí po všech zadaných transformacích Pythonu.
Výchozí hodnota je None.
ml_transform_vars
Určuje vektor znaku názvů proměnných, který má být použit v ml_transforms nebo None , pokud se žádný použít.
Výchozí hodnota je None.
row_selection
NEPODPORUJE SE. Určuje řádky (pozorování) ze sady dat, které má model používat s názvem logické proměnné ze sady dat (v uvozovkách) nebo logickým výrazem pomocí proměnných v sadě dat. Příklady:
row_selection = "old"použije pouze pozorování, ve kterých jeoldhodnota proměnnéTrue.row_selection = (age > 20) & (age < 65) & (log(income) > 10)používá pouze pozorování, ve kterých je hodnotaageproměnné mezi 20 a 65 a hodnotoulogincomeproměnné je větší než 10.
Výběr řádku se provede po zpracování všech transformací dat (viz argumenty transforms nebo transform_function). Stejně jako u všech výrazů row_selection je možné definovat mimo volání funkce pomocí expression funkce.
transformuje
NEPODPORUJE SE. Výraz formuláře, který představuje první kolo transformací proměnných. Stejně jako u všech výrazů transforms je možné definovat (nebo row_selection) mimo volání funkce pomocí expression funkce.
Výchozí hodnota je None.
transform_objects
NEPODPORUJE SE. Pojmenovaný seznam obsahující objekty, na které lze odkazovat pomocí transforms, transform_functiona row_selection. Výchozí hodnota je None.
transform_function
Proměnná transformační funkce. Výchozí hodnota je None.
transform_variables
Znakový vektor vstupních proměnných množiny dat potřebných pro transformační funkci. Výchozí hodnota je None.
transform_packages
NEPODPORUJE SE. Vektor znaku určující další balíčky Pythonu (mimo balíčky zadané v RxOptions.get_option("transform_packages")) k dispozici a předem načtený pro použití v transformačních funkcích proměnných.
Například explicitně definované v funkcích revoscalepy prostřednictvím jejich transforms a transform_function argumentů nebo těch, které jsou definovány implicitně prostřednictvím jejich formula nebo row_selection argumentů. Argumentem transform_packages může být také Žádný, což znamená, že nejsou předem načteny žádné balíčky mimo RxOptions.get_option("transform_packages") .
transform_environment
NEPODPORUJE SE. Uživatelem definované prostředí, které bude sloužit jako nadřazené všem prostředím vyvinutým interně a které se používají k transformaci proměnných dat.
Pokud transform_environment = None, místo toho se použije nové "hash" prostředí s rodičem revoscalepy.baseenv . Výchozí hodnota je None.
blocks_per_read
Určuje početblokůch
report_progress
Celočíselná hodnota, která určuje úroveň generování sestav o průběhu zpracování řádků:
0: Nebyl hlášen žádný průběh.1: Počet zpracovaných řádků se vytiskne a aktualizuje.2: Jsou hlášeny řádky zpracovávané a časování.3: Jsou hlášeny řádky zpracovávané a všechna časování.
Výchozí hodnota je 1.
podrobný
Celočíselná hodnota, která určuje požadovanou velikost výstupu.
Pokud 0se během výpočtů nevytiskne žádný podrobný výstup. Celočíselné hodnoty, od 1 které se 4 poskytují rostoucí množství informací.
Výchozí hodnota je 1.
compute_context
Nastaví kontext, ve kterém se výpočty spouštějí, zadané pomocí platné revoscalepy. RxComputeContext. V současné době místní a revoscalepy. Podporují se výpočetní kontexty RxInSqlServer .
Returns
Datový rámec nebo revoskalepie. objekt RxDataSource reprezentující vytvořená výstupní data.
Example
'''
Example with rx_featurize.
'''
import numpy
import pandas
from microsoftml import rx_featurize, categorical
# rx_featurize basically allows you to access data from the MicrosoftML transforms
# In this example we'll look at getting the output of the categorical transform
# Create the data
categorical_data = pandas.DataFrame(data=dict(places_visited=[
"London", "Brunei", "London", "Paris", "Seria"]),
dtype="category")
print(categorical_data)
# Invoke the categorical transform
categorized = rx_featurize(data=categorical_data,
ml_transforms=[categorical(cols=dict(xdatacat="places_visited"))])
# Now let's look at the data
print(categorized)
Output:
places_visited
0 London
1 Brunei
2 London
3 Paris
4 Seria
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0521300
Finished writing 5 rows.
Writing completed.
places_visited xdatacat.London xdatacat.Brunei xdatacat.Paris \
0 London 1.0 0.0 0.0
1 Brunei 0.0 1.0 0.0
2 London 1.0 0.0 0.0
3 Paris 0.0 0.0 1.0
4 Seria 0.0 0.0 0.0
xdatacat.Seria
0 0.0
1 0.0
2 0.0
3 0.0
4 1.0