Ескертпе
Бұл бетке кіру үшін қатынас шегін айқындау қажет. Жүйеге кіруді немесе каталогтарды өзгертуді байқап көруге болады.
Бұл бетке кіру үшін қатынас шегін айқындау қажет. Каталогтарды өзгертуді байқап көруге болады.
Usage
microsoftml.rx_featurize(data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
pandas.core.frame.DataFrame],
output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
str] = None, overwrite: bool = False,
data_threads: int = None, random_seed: int = None,
max_slots: int = 5000, ml_transforms: list = None,
ml_transform_vars: list = None, row_selection: str = None,
transforms: dict = None, transform_objects: dict = None,
transform_function: str = None,
transform_variables: list = None,
transform_packages: list = None,
transform_environment: dict = None, blocks_per_read: int = None,
report_progress: int = None, verbose: int = 1,
compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None)
Description
Преобразует данные из входного набора данных в выходной.
Arguments
Данные
Объект источника данных с ревоскейлированием , фрейм данных или путь к .xdf файлу.
output_data
Выводите текст или имя файла xdf, либо RxDataSource с возможностью записи для хранения преобразованных данных. Если нет — возвращается кадр данных. Значение по умолчанию — None.
перезаписать
Если True, существующий output_data перезаписан; если False существующий output_data не перезаписан. Значение по умолчанию — False.
data_threads
Целое число, указывающее желаемую степень параллелизма в конвейере данных. Если нет, количество используемых потоков определяется внутренне. Значение по умолчанию — None.
random_seed
Указывает случайное начальное значение. Значение по умолчанию — None.
max_slots
Максимальные слоты для возврата для столбцов с векторными значениями (<=0 для возврата всех).
ml_transforms
Указывает список преобразований MicrosoftML для выполнения данных перед обучением или Нет , если преобразования не выполняются. См featurize_text. раздел , categoricalа также categorical_hashсведения о поддерживаемых преобразованиях.
Эти преобразования выполняются после любых указанных преобразований Python.
Значение по умолчанию — None.
ml_transform_vars
Указывает вектор символов имен переменных, используемых или ml_transformsнет , если они не используются.
Значение по умолчанию — None.
row_selection
НЕ ПОДДЕРЖИВАЕТСЯ. Указывает строки (наблюдения) из набора данных, которые должны использоваться моделью с именем логической переменной из набора данных (в кавычках) или логическим выражением с помощью переменных в наборе данных. Рассмотрим пример.
row_selection = "old"используются только наблюдения, в которых значение переменнойoldравноTrue.row_selection = (age > 20) & (age < 65) & (log(income) > 10)Использует только наблюдения, в которых значениеageпеременной составляет от 20 до 65, а значениеlogпеременнойincomeбольше 10.
Выбор строки выполняется после обработки любых преобразований данных (см. аргументы transforms или transform_function). Как и во всех выражениях, row_selection можно определить вне вызова функции с помощью expression функции.
Преобразует
НЕ ПОДДЕРЖИВАЕТСЯ. Выражение формы, представляющей первый раунд преобразований переменных. Как и во всех выражениях, transforms (или row_selection) можно определить вне вызова функции с помощью expression функции.
Значение по умолчанию — None.
transform_objects
НЕ ПОДДЕРЖИВАЕТСЯ. Именованный список, содержащий объекты, на которые можно ссылаться, transformstransform_functionи row_selection. Значение по умолчанию — None.
transform_function
Функция преобразования переменной. Значение по умолчанию — None.
transform_variables
Символьный вектор входных переменных набора данных, необходимых для функции преобразования. Значение по умолчанию — None.
transform_packages
НЕ ПОДДЕРЖИВАЕТСЯ. Вектор символов, указывающий дополнительные пакеты Python (за пределами указанных в RxOptions.get_option("transform_packages")) для обеспечения доступности и предварительной загрузки для использования в функциях преобразования переменных.
Например, те, которые явно определены в функциях revoscalepy через их transforms аргументы или transform_function те, которые определены неявно через их formula или row_selection аргументы. Аргумент transform_packages также может быть None, указывающий, что пакеты за пределами RxOptions.get_option("transform_packages") предварительно загружены.
transform_environment
НЕ ПОДДЕРЖИВАЕТСЯ. Определяемая пользователем среда, которая служит родительской средой для всех сред, разработанных внутренне и используется для преобразования данных переменных.
Если transform_environment = Noneвместо этого используется новая среда «хэш» с родительским revoscalepy.baseenv, значение по умолчанию — None.
blocks_per_read
Указывает количество блоков для чтения для каждого блока данных, считываемого из источника данных.
report_progress
Целочисленное значение, указывающее уровень отчетов о ходе обработки строк:
0: не сообщается о ходе выполнения.1: количество обработанных строк печатается и обновляется.2: отображаются строки, обрабатываемые и сроки.3: обрабатываются строки и сообщаются все сроки.
Значение по умолчанию — 1.
verbose
Целочисленное значение, указывающее количество нужных выходных данных.
Если 0подробные выходные данные не печатаются во время вычислений. Целые значения от 1 того, чтобы 4 обеспечить увеличение объема информации.
Значение по умолчанию — 1.
compute_context
Задает контекст, в котором выполняются вычисления, указанные с допустимым revoscalepy. RxComputeContext. В настоящее время локальная и revoscalepy. Поддерживаются контексты вычислений RxInSqlServer.
Returns
Фрейм данных или ревоскейлирование. Объект RxDataSource , представляющий созданные выходные данные.
Пример
'''
Example with rx_featurize.
'''
import numpy
import pandas
from microsoftml import rx_featurize, categorical
# rx_featurize basically allows you to access data from the MicrosoftML transforms
# In this example we'll look at getting the output of the categorical transform
# Create the data
categorical_data = pandas.DataFrame(data=dict(places_visited=[
"London", "Brunei", "London", "Paris", "Seria"]),
dtype="category")
print(categorical_data)
# Invoke the categorical transform
categorized = rx_featurize(data=categorical_data,
ml_transforms=[categorical(cols=dict(xdatacat="places_visited"))])
# Now let's look at the data
print(categorized)
Выходные данные:
places_visited
0 London
1 Brunei
2 London
3 Paris
4 Seria
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0521300
Finished writing 5 rows.
Writing completed.
places_visited xdatacat.London xdatacat.Brunei xdatacat.Paris \
0 London 1.0 0.0 0.0
1 Brunei 0.0 1.0 0.0
2 London 1.0 0.0 0.0
3 Paris 0.0 0.0 1.0
4 Seria 0.0 0.0 0.0
xdatacat.Seria
0 0.0
1 0.0
2 0.0
3 0.0
4 1.0