microsoftml.rx_featurize: 데이터 소스를 위한 데이터 변환

Usage

microsoftml.rx_featurize(data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
    pandas.core.frame.DataFrame],
    output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
    str] = None, overwrite: bool = False,
    data_threads: int = None, random_seed: int = None,
    max_slots: int = 5000, ml_transforms: list = None,
    ml_transform_vars: list = None, row_selection: str = None,
    transforms: dict = None, transform_objects: dict = None,
    transform_function: str = None,
    transform_variables: list = None,
    transform_packages: list = None,
    transform_environment: dict = None, blocks_per_read: int = None,
    report_progress: int = None, verbose: int = 1,
    compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None)

설명

입력 데이터 세트에서 출력 데이터 세트로 변환합니다.

Arguments

data

revoscalepy 데이터 소스 객체, 데이터 프레임, 또는 파일로 가는 .xdf 경로 등이 있습니다.

output_data

변환된 데이터를 저장할 수 있는 출력 텍스트 또는 xdf 파일 이름 또는 RxDataSource 쓰기 기능을 제공합니다. 으면 데이터 프레임이 반환됩니다. 기본 값은 None입니다.

덮어쓸

만약 True, 존재 output_data 하는 것이 덮어쓰여진다면; 존재 output_data 하는 것이 덮어쓰여지지 않았다 False 면. 기본값은 False입니다.

data_threads

데이터 파이프라인에서 원하는 병렬성 정도를 지정하는 정수. 으면 내부적으로 사용되는 스레드 수가 결정됩니다. 기본 값은 None입니다.

random_seed

임의 시드를 지정합니다. 기본 값은 None입니다.

max_slots

벡터 값 열을 반환할 최대 슬롯 (<=0 반환).

ml_transforms

학습 전에 데이터에 대해 수행할 MicrosoftML 변환 목록을 지정하거나 변환을 수행할 항목이 없으면 None 을 지정합니다. 지원되는 변환은 , featurize_textcategorical,를 참조categorical_hash하세요. 이러한 변환은 지정된 Python 변환 후에 수행됩니다. 기본 값은 None입니다.

ml_transform_vars

사용할 변수 이름의 문자 벡터를 지정하거나 사용할 ml_transforms 변수가 없는 경우 None 을 지정합니다. 기본 값은 None입니다.

row_selection

지원되지 않습니다. 데이터 집합의 논리 변수 이름(따옴표)을 사용하거나 데이터 집합의 변수를 사용하는 논리 식과 함께 모델에서 사용할 데이터 집합의 행(관찰)을 지정합니다. 다음은 그 예입니다.

  • row_selection = "old" 는 변수 oldTrue값이 있는 관찰만 사용합니다.

  • row_selection = (age > 20) & (age < 65) & (log(income) > 10)변수 값이 20에서 65 agelog 사이이고 변수 값 income 이 10보다 큰 관찰만 사용합니다.

행 선택은 데이터 변환을 처리한 후 수행됩니다(인수 transforms 또는 transform_function참조). 모든 식과 마찬가지로 함수 row_selection 를 사용하여 expression 함수 호출 외부에서 정의할 수 있습니다.

변환

지원되지 않습니다. 변수 변환의 첫 번째 라운드를 나타내는 폼의 식입니다. 모든 식과 마찬가지로 함수를 transforms 사용하여 row_selection 함수 호출 외부에서 정의expression할 수 있습니다. 기본 값은 None입니다.

transform_objects

지원되지 않습니다. , transformstransform_function.에서 참조할 수 있는 개체가 포함된 명명된 row_selection목록입니다. 기본 값은 None입니다.

transform_function

변수 변환 함수입니다. 기본 값은 None입니다.

transform_variables

변환 함수에 필요한 입력 데이터 집합 변수의 문자 벡터입니다. 기본 값은 None입니다.

transform_packages

지원되지 않습니다. 가변 변환 함수에 RxOptions.get_option("transform_packages")사용할 수 있도록 미리 로드할 추가 Python 패키지(지정된 패키지 외부)를 지정하는 문자 벡터입니다. 예를 들어 해당 함수와 인수를 통해 transformstransform_function 함수에 명시적으로 정의되거나 해당 함수 또는 formula 인수를 통해 row_selection 암시적으로 정의된 함수입니다. 인수는 transform_packages외부RxOptions.get_option("transform_packages") 패키지가 미리 로드되지 않았음을 나타내는 None일 수도 있습니다.

transform_environment

지원되지 않습니다. 내부적으로 개발되어 변수 데이터 변환에 사용되는 모든 환경의 부모 역할을 하는 사용자 정의 환경입니다. 만약 , 이면 transform_environment = None, 대신 부모 revoscalepy.baseenv를 가진 새로운 "해시" 환경을 사용합니다. 기본 값은 None입니다.

blocks_per_read

데이터 원본에서 읽은 데이터의 각 청크에 대해 읽을 블록 수를 지정합니다.

report_progress

행 처리 진행률에 대한 보고 수준을 지정하는 정수 값입니다.

  • 0: 진행률이 보고되지 않습니다.

  • 1: 처리된 행 수가 인쇄되고 업데이트됩니다.

  • 2: 행이 처리되고 타이밍이 보고됩니다.

  • 3: 행이 처리되고 모든 타이밍이 보고됩니다.

기본값은 1입니다.

verbose

원하는 출력의 양을 지정하는 정수 값입니다. 이 경우 0계산 중에 자세한 정보 출력이 인쇄되지 않습니다. 증가하는 양의 정보를 제공하기 위한 1 정수 값 4 입니다. 기본값은 1입니다.

compute_context

계산이 실행되고 유효한 revoscalepy로 지정된 컨텍스트를 설정합니다. RxComputeContext. 현재 로컬 및 revoscalepy입니다. RxInSqlServer 컴퓨팅 컨텍스트가 지원됩니다.

Returns

데이터 프레임이나 레보스케일피. 생성된 출력 데이터를 나타내는 RxDataSource 객체입니다.

Example

'''
Example with rx_featurize.
'''
import numpy
import pandas
from microsoftml import rx_featurize, categorical

# rx_featurize basically allows you to access data from the MicrosoftML transforms
# In this example we'll look at getting the output of the categorical transform
# Create the data
categorical_data = pandas.DataFrame(data=dict(places_visited=[
                "London", "Brunei", "London", "Paris", "Seria"]),
                dtype="category")
                
print(categorical_data)

# Invoke the categorical transform
categorized = rx_featurize(data=categorical_data,
                           ml_transforms=[categorical(cols=dict(xdatacat="places_visited"))])

# Now let's look at the data
print(categorized)

Output:

  places_visited
0         London
1         Brunei
2         London
3          Paris
4          Seria
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0521300
Finished writing 5 rows.
Writing completed.
  places_visited  xdatacat.London  xdatacat.Brunei  xdatacat.Paris  \
0         London              1.0              0.0             0.0   
1         Brunei              0.0              1.0             0.0   
2         London              1.0              0.0             0.0   
3          Paris              0.0              0.0             1.0   
4          Seria              0.0              0.0             0.0   

   xdatacat.Seria  
0             0.0  
1             0.0  
2             0.0  
3             0.0  
4             1.0