Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Usage
microsoftml.rx_featurize(data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
pandas.core.frame.DataFrame],
output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
str] = None, overwrite: bool = False,
data_threads: int = None, random_seed: int = None,
max_slots: int = 5000, ml_transforms: list = None,
ml_transform_vars: list = None, row_selection: str = None,
transforms: dict = None, transform_objects: dict = None,
transform_function: str = None,
transform_variables: list = None,
transform_packages: list = None,
transform_environment: dict = None, blocks_per_read: int = None,
report_progress: int = None, verbose: int = 1,
compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None)
Description
Przekształca dane ze zbioru danych wejściowych na zbiór danych wyjściowych.
Arguments
dane
Obiekt źródłowy revoskale, ramka danych lub ścieżka do pliku .xdf .
output_data
Wyjście tekstu lub nazwy pliku xdf lub z RxDataSource możliwością zapisu do przechowywania przekształconych danych. Jeśli Brak, zwrócona jest ramka danych. Wartość domyślna to Brak.
zastąpić
Jeśli True, istniejące output_data jest nadpisane; jeśli False istniejące output_data nie jest nadpisane. Wartość domyślna to False.
data_threads
Liczba całkowita określająca pożądany stopień równoległości w potoku danych. Jeśli Zero, liczba użytych wątków jest ustalana wewnętrznie. Wartość domyślna to Brak.
random_seed
Określa losowe inicjatora. Wartość domyślna to Brak.
max_slots
Maksymalna liczba slotów do zwracania dla kolumn o wartościach wektorowych (<=0 do zwrotu wszystkich).
ml_transforms
Określa listę przekształceń MicrosoftML, które mają być wykonywane na danych przed trenowanie lub Brak , jeśli nie mają być wykonywane żadne przekształcenia. Zobacz featurize_text, categoricali categorical_hash, aby zapoznać się z obsługiwanymi przekształceniami.
Te przekształcenia są wykonywane po wszelkich określonych przekształceniach języka Python.
Wartość domyślna to Brak.
ml_transform_vars
Określa wektor znaków nazw zmiennych do użycia w ml_transforms lub Brak , jeśli nie ma być używany.
Wartość domyślna to Brak.
row_selection
NIEOBSŁUGIWANE. Określa wiersze (obserwacje) z zestawu danych, które mają być używane przez model z nazwą zmiennej logicznej z zestawu danych (w cudzysłowie) lub z wyrażeniem logicznym przy użyciu zmiennych w zestawie danych. Przykład:
row_selection = "old"będzie używać tylko obserwacji, w których wartość zmiennejoldtoTrue.row_selection = (age > 20) & (age < 65) & (log(income) > 10)Używa tylko obserwacji, w których wartośćagezmiennej wynosi od 20 do 65, a wartośćlogzmiennejincomejest większa niż 10.
Wybór wiersza jest wykonywany po przetworzeniu wszystkich przekształceń danych (zobacz argumenty transforms lub transform_function). Podobnie jak w przypadku wszystkich wyrażeń, row_selection można zdefiniować poza wywołaniem funkcji przy użyciu expression funkcji.
Przekształca
NIEOBSŁUGIWANE. Wyrażenie formularza reprezentującego pierwszą rundę przekształceń zmiennych. Podobnie jak w przypadku wszystkich wyrażeń transforms (lub row_selection) można zdefiniować poza wywołaniem funkcji przy użyciu expression funkcji .
Wartość domyślna to Brak.
transform_objects
NIEOBSŁUGIWANE. Nazwana lista zawierająca obiekty, do których można odwoływać się w transformselementach , transform_functioni row_selection. Wartość domyślna to Brak.
transform_function
Funkcja przekształcania zmiennej. Wartość domyślna to Brak.
transform_variables
Wektor znaków zmiennych zestawu danych wejściowych potrzebnych do funkcji przekształcania. Wartość domyślna to Brak.
transform_packages
NIEOBSŁUGIWANE. Wektor znaków określający dodatkowe pakiety języka Python (poza określonymi w ) RxOptions.get_option("transform_packages")do udostępnienia i wstępnie załadowane do użycia w funkcjach przekształcania zmiennych.
Na przykład te jawnie zdefiniowane w funkcjach revoscalepy za pośrednictwem ich transforms argumentów i transform_function lub zdefiniowanych niejawnie za pośrednictwem ich formula lub row_selection argumentów. Argumentem transform_packages może być również Brak wskazujący, że żadne pakiety poza nie RxOptions.get_option("transform_packages") są wstępnie ładowane.
transform_environment
NIEOBSŁUGIWANE. Środowisko zdefiniowane przez użytkownika, które służy jako element nadrzędny dla wszystkich środowisk opracowanych wewnętrznie i używanych do przekształcania danych zmiennych.
Jeśli , transform_environment = Nonezamiast tego używa się nowego środowiska "haszującego" z nadrzędnym revoscalepy.baseenv . Domyślna wartość to None.
blocks_per_read
Określa liczbę bloków do odczytu dla każdego fragmentu danych odczytywanych ze źródła danych.
report_progress
Wartość całkowita określająca poziom raportowania postępu przetwarzania wierszy:
0: nie zgłoszono żadnego postępu.1: liczba przetworzonych wierszy jest drukowana i aktualizowana.2: są zgłaszane przetworzone wiersze i chronometraż.3: są zgłaszane wiersze przetworzone i wszystkie chronometraż.
Wartość domyślna to 1.
pełny
Wartość całkowita określająca ilość żądanych danych wyjściowych.
Jeśli 0podczas obliczeń nie są drukowane żadne pełne dane wyjściowe. Wartości całkowite z 1 , aby 4 zapewnić coraz większe ilości informacji.
Wartość domyślna to 1.
compute_context
Ustawia kontekst, w którym są wykonywane obliczenia określone przy użyciu prawidłowej wersji revoscalepy. RxComputeContext. Obecnie lokalne i revoscalepy. Obsługiwane są konteksty obliczeniowe RxInSqlServer .
Zwroty
Ramka danych lub revoskalepa. Obiekt RxDataSource reprezentujący utworzone dane wyjściowe.
Example
'''
Example with rx_featurize.
'''
import numpy
import pandas
from microsoftml import rx_featurize, categorical
# rx_featurize basically allows you to access data from the MicrosoftML transforms
# In this example we'll look at getting the output of the categorical transform
# Create the data
categorical_data = pandas.DataFrame(data=dict(places_visited=[
"London", "Brunei", "London", "Paris", "Seria"]),
dtype="category")
print(categorical_data)
# Invoke the categorical transform
categorized = rx_featurize(data=categorical_data,
ml_transforms=[categorical(cols=dict(xdatacat="places_visited"))])
# Now let's look at the data
print(categorized)
Output:
places_visited
0 London
1 Brunei
2 London
3 Paris
4 Seria
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0521300
Finished writing 5 rows.
Writing completed.
places_visited xdatacat.London xdatacat.Brunei xdatacat.Paris \
0 London 1.0 0.0 0.0
1 Brunei 0.0 1.0 0.0
2 London 1.0 0.0 0.0
3 Paris 0.0 0.0 1.0
4 Seria 0.0 0.0 0.0
xdatacat.Seria
0 0.0
1 0.0
2 0.0
3 0.0
4 1.0