Usage
microsoftml.rx_featurize(data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
pandas.core.frame.DataFrame],
output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
str] = None, overwrite: bool = False,
data_threads: int = None, random_seed: int = None,
max_slots: int = 5000, ml_transforms: list = None,
ml_transform_vars: list = None, row_selection: str = None,
transforms: dict = None, transform_objects: dict = None,
transform_function: str = None,
transform_variables: list = None,
transform_packages: list = None,
transform_environment: dict = None, blocks_per_read: int = None,
report_progress: int = None, verbose: int = 1,
compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None)
설명
입력 데이터 세트에서 출력 데이터 세트로 변환합니다.
Arguments
data
revoscalepy 데이터 소스 객체, 데이터 프레임, 또는 파일로 가는 .xdf 경로 등이 있습니다.
output_data
변환된 데이터를 저장할 수 있는 출력 텍스트 또는 xdf 파일 이름 또는 RxDataSource 쓰기 기능을 제공합니다.
없으면 데이터 프레임이 반환됩니다. 기본 값은 None입니다.
덮어쓸
만약 True, 존재 output_data 하는 것이 덮어쓰여진다면; 존재 output_data 하는 것이 덮어쓰여지지 않았다 False 면. 기본값은 False입니다.
data_threads
데이터 파이프라인에서 원하는 병렬성 정도를 지정하는 정수. 없으면 내부적으로 사용되는 스레드 수가 결정됩니다. 기본 값은 None입니다.
random_seed
임의 시드를 지정합니다. 기본 값은 None입니다.
max_slots
벡터 값 열을 반환할 최대 슬롯 (<=0 반환).
ml_transforms
학습 전에 데이터에 대해 수행할 MicrosoftML 변환 목록을 지정하거나 변환을 수행할 항목이 없으면 None 을 지정합니다. 지원되는 변환은 , featurize_text및 categorical,를 참조categorical_hash하세요.
이러한 변환은 지정된 Python 변환 후에 수행됩니다.
기본 값은 None입니다.
ml_transform_vars
사용할 변수 이름의 문자 벡터를 지정하거나 사용할 ml_transforms 변수가 없는 경우 None 을 지정합니다.
기본 값은 None입니다.
row_selection
지원되지 않습니다. 데이터 집합의 논리 변수 이름(따옴표)을 사용하거나 데이터 집합의 변수를 사용하는 논리 식과 함께 모델에서 사용할 데이터 집합의 행(관찰)을 지정합니다. 다음은 그 예입니다.
row_selection = "old"는 변수oldTrue값이 있는 관찰만 사용합니다.row_selection = (age > 20) & (age < 65) & (log(income) > 10)변수 값이 20에서 65agelog사이이고 변수 값income이 10보다 큰 관찰만 사용합니다.
행 선택은 데이터 변환을 처리한 후 수행됩니다(인수 transforms 또는 transform_function참조). 모든 식과 마찬가지로 함수 row_selection 를 사용하여 expression 함수 호출 외부에서 정의할 수 있습니다.
변환
지원되지 않습니다. 변수 변환의 첫 번째 라운드를 나타내는 폼의 식입니다. 모든 식과 마찬가지로 함수를 transforms 사용하여 row_selection 함수 호출 외부에서 정의expression할 수 있습니다.
기본 값은 None입니다.
transform_objects
지원되지 않습니다. , transforms및 transform_function.에서 참조할 수 있는 개체가 포함된 명명된 row_selection목록입니다. 기본 값은 None입니다.
transform_function
변수 변환 함수입니다. 기본 값은 None입니다.
transform_variables
변환 함수에 필요한 입력 데이터 집합 변수의 문자 벡터입니다. 기본 값은 None입니다.
transform_packages
지원되지 않습니다. 가변 변환 함수에 RxOptions.get_option("transform_packages")사용할 수 있도록 미리 로드할 추가 Python 패키지(지정된 패키지 외부)를 지정하는 문자 벡터입니다.
예를 들어 해당 함수와 인수를 통해 transformstransform_function 함수에 명시적으로 정의되거나 해당 함수 또는 formula 인수를 통해 row_selection 암시적으로 정의된 함수입니다. 인수는 transform_packages외부RxOptions.get_option("transform_packages") 패키지가 미리 로드되지 않았음을 나타내는 None일 수도 있습니다.
transform_environment
지원되지 않습니다. 내부적으로 개발되어 변수 데이터 변환에 사용되는 모든 환경의 부모 역할을 하는 사용자 정의 환경입니다.
만약 , 이면 transform_environment = None, 대신 부모 revoscalepy.baseenv를 가진 새로운 "해시" 환경을 사용합니다. 기본 값은 None입니다.
blocks_per_read
데이터 원본에서 읽은 데이터의 각 청크에 대해 읽을 블록 수를 지정합니다.
report_progress
행 처리 진행률에 대한 보고 수준을 지정하는 정수 값입니다.
0: 진행률이 보고되지 않습니다.1: 처리된 행 수가 인쇄되고 업데이트됩니다.2: 행이 처리되고 타이밍이 보고됩니다.3: 행이 처리되고 모든 타이밍이 보고됩니다.
기본값은 1입니다.
verbose
원하는 출력의 양을 지정하는 정수 값입니다.
이 경우 0계산 중에 자세한 정보 출력이 인쇄되지 않습니다. 증가하는 양의 정보를 제공하기 위한 1 정수 값 4 입니다.
기본값은 1입니다.
compute_context
계산이 실행되고 유효한 revoscalepy로 지정된 컨텍스트를 설정합니다. RxComputeContext. 현재 로컬 및 revoscalepy입니다. RxInSqlServer 컴퓨팅 컨텍스트가 지원됩니다.
Returns
데이터 프레임이나 레보스케일피. 생성된 출력 데이터를 나타내는 RxDataSource 객체입니다.
Example
'''
Example with rx_featurize.
'''
import numpy
import pandas
from microsoftml import rx_featurize, categorical
# rx_featurize basically allows you to access data from the MicrosoftML transforms
# In this example we'll look at getting the output of the categorical transform
# Create the data
categorical_data = pandas.DataFrame(data=dict(places_visited=[
"London", "Brunei", "London", "Paris", "Seria"]),
dtype="category")
print(categorical_data)
# Invoke the categorical transform
categorized = rx_featurize(data=categorical_data,
ml_transforms=[categorical(cols=dict(xdatacat="places_visited"))])
# Now let's look at the data
print(categorized)
Output:
places_visited
0 London
1 Brunei
2 London
3 Paris
4 Seria
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0521300
Finished writing 5 rows.
Writing completed.
places_visited xdatacat.London xdatacat.Brunei xdatacat.Paris \
0 London 1.0 0.0 0.0
1 Brunei 0.0 1.0 0.0
2 London 1.0 0.0 0.0
3 Paris 0.0 0.0 1.0
4 Seria 0.0 0.0 0.0
xdatacat.Seria
0 0.0
1 0.0
2 0.0
3 0.0
4 1.0