microsoftml.rx_featurize: Transformacja danych dla źródeł danych

Usage

microsoftml.rx_featurize(data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
    pandas.core.frame.DataFrame],
    output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
    str] = None, overwrite: bool = False,
    data_threads: int = None, random_seed: int = None,
    max_slots: int = 5000, ml_transforms: list = None,
    ml_transform_vars: list = None, row_selection: str = None,
    transforms: dict = None, transform_objects: dict = None,
    transform_function: str = None,
    transform_variables: list = None,
    transform_packages: list = None,
    transform_environment: dict = None, blocks_per_read: int = None,
    report_progress: int = None, verbose: int = 1,
    compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None)

Description

Przekształca dane ze zbioru danych wejściowych na zbiór danych wyjściowych.

Arguments

dane

Obiekt źródłowy revoskale, ramka danych lub ścieżka do pliku .xdf .

output_data

Wyjście tekstu lub nazwy pliku xdf lub z RxDataSource możliwością zapisu do przechowywania przekształconych danych. Jeśli Brak, zwrócona jest ramka danych. Wartość domyślna to Brak.

zastąpić

Jeśli True, istniejące output_data jest nadpisane; jeśli False istniejące output_data nie jest nadpisane. Wartość domyślna to False.

data_threads

Liczba całkowita określająca pożądany stopień równoległości w potoku danych. Jeśli Zero, liczba użytych wątków jest ustalana wewnętrznie. Wartość domyślna to Brak.

random_seed

Określa losowe inicjatora. Wartość domyślna to Brak.

max_slots

Maksymalna liczba slotów do zwracania dla kolumn o wartościach wektorowych (<=0 do zwrotu wszystkich).

ml_transforms

Określa listę przekształceń MicrosoftML, które mają być wykonywane na danych przed trenowanie lub Brak , jeśli nie mają być wykonywane żadne przekształcenia. Zobacz featurize_text, categoricali categorical_hash, aby zapoznać się z obsługiwanymi przekształceniami. Te przekształcenia są wykonywane po wszelkich określonych przekształceniach języka Python. Wartość domyślna to Brak.

ml_transform_vars

Określa wektor znaków nazw zmiennych do użycia w ml_transforms lub Brak , jeśli nie ma być używany. Wartość domyślna to Brak.

row_selection

NIEOBSŁUGIWANE. Określa wiersze (obserwacje) z zestawu danych, które mają być używane przez model z nazwą zmiennej logicznej z zestawu danych (w cudzysłowie) lub z wyrażeniem logicznym przy użyciu zmiennych w zestawie danych. Przykład:

  • row_selection = "old" będzie używać tylko obserwacji, w których wartość zmiennej old to True.

  • row_selection = (age > 20) & (age < 65) & (log(income) > 10) Używa tylko obserwacji, w których wartość age zmiennej wynosi od 20 do 65, a wartość log zmiennej income jest większa niż 10.

Wybór wiersza jest wykonywany po przetworzeniu wszystkich przekształceń danych (zobacz argumenty transforms lub transform_function). Podobnie jak w przypadku wszystkich wyrażeń, row_selection można zdefiniować poza wywołaniem funkcji przy użyciu expression funkcji.

Przekształca

NIEOBSŁUGIWANE. Wyrażenie formularza reprezentującego pierwszą rundę przekształceń zmiennych. Podobnie jak w przypadku wszystkich wyrażeń transforms (lub row_selection) można zdefiniować poza wywołaniem funkcji przy użyciu expression funkcji . Wartość domyślna to Brak.

transform_objects

NIEOBSŁUGIWANE. Nazwana lista zawierająca obiekty, do których można odwoływać się w transformselementach , transform_functioni row_selection. Wartość domyślna to Brak.

transform_function

Funkcja przekształcania zmiennej. Wartość domyślna to Brak.

transform_variables

Wektor znaków zmiennych zestawu danych wejściowych potrzebnych do funkcji przekształcania. Wartość domyślna to Brak.

transform_packages

NIEOBSŁUGIWANE. Wektor znaków określający dodatkowe pakiety języka Python (poza określonymi w ) RxOptions.get_option("transform_packages")do udostępnienia i wstępnie załadowane do użycia w funkcjach przekształcania zmiennych. Na przykład te jawnie zdefiniowane w funkcjach revoscalepy za pośrednictwem ich transforms argumentów i transform_function lub zdefiniowanych niejawnie za pośrednictwem ich formula lub row_selection argumentów. Argumentem transform_packages może być również Brak wskazujący, że żadne pakiety poza nie RxOptions.get_option("transform_packages") są wstępnie ładowane.

transform_environment

NIEOBSŁUGIWANE. Środowisko zdefiniowane przez użytkownika, które służy jako element nadrzędny dla wszystkich środowisk opracowanych wewnętrznie i używanych do przekształcania danych zmiennych. Jeśli , transform_environment = Nonezamiast tego używa się nowego środowiska "haszującego" z nadrzędnym revoscalepy.baseenv . Domyślna wartość to None.

blocks_per_read

Określa liczbę bloków do odczytu dla każdego fragmentu danych odczytywanych ze źródła danych.

report_progress

Wartość całkowita określająca poziom raportowania postępu przetwarzania wierszy:

  • 0: nie zgłoszono żadnego postępu.

  • 1: liczba przetworzonych wierszy jest drukowana i aktualizowana.

  • 2: są zgłaszane przetworzone wiersze i chronometraż.

  • 3: są zgłaszane wiersze przetworzone i wszystkie chronometraż.

Wartość domyślna to 1.

pełny

Wartość całkowita określająca ilość żądanych danych wyjściowych. Jeśli 0podczas obliczeń nie są drukowane żadne pełne dane wyjściowe. Wartości całkowite z 1 , aby 4 zapewnić coraz większe ilości informacji. Wartość domyślna to 1.

compute_context

Ustawia kontekst, w którym są wykonywane obliczenia określone przy użyciu prawidłowej wersji revoscalepy. RxComputeContext. Obecnie lokalne i revoscalepy. Obsługiwane są konteksty obliczeniowe RxInSqlServer .

Zwroty

Ramka danych lub revoskalepa. Obiekt RxDataSource reprezentujący utworzone dane wyjściowe.

Example

'''
Example with rx_featurize.
'''
import numpy
import pandas
from microsoftml import rx_featurize, categorical

# rx_featurize basically allows you to access data from the MicrosoftML transforms
# In this example we'll look at getting the output of the categorical transform
# Create the data
categorical_data = pandas.DataFrame(data=dict(places_visited=[
                "London", "Brunei", "London", "Paris", "Seria"]),
                dtype="category")
                
print(categorical_data)

# Invoke the categorical transform
categorized = rx_featurize(data=categorical_data,
                           ml_transforms=[categorical(cols=dict(xdatacat="places_visited"))])

# Now let's look at the data
print(categorized)

Output:

  places_visited
0         London
1         Brunei
2         London
3          Paris
4          Seria
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0521300
Finished writing 5 rows.
Writing completed.
  places_visited  xdatacat.London  xdatacat.Brunei  xdatacat.Paris  \
0         London              1.0              0.0             0.0   
1         Brunei              0.0              1.0             0.0   
2         London              1.0              0.0             0.0   
3          Paris              0.0              0.0             1.0   
4          Seria              0.0              0.0             0.0   

   xdatacat.Seria  
0             0.0  
1             0.0  
2             0.0  
3             0.0  
4             1.0