Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Usage
microsoftml.rx_featurize(data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
pandas.core.frame.DataFrame],
output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
str] = None, overwrite: bool = False,
data_threads: int = None, random_seed: int = None,
max_slots: int = 5000, ml_transforms: list = None,
ml_transform_vars: list = None, row_selection: str = None,
transforms: dict = None, transform_objects: dict = None,
transform_function: str = None,
transform_variables: list = None,
transform_packages: list = None,
transform_environment: dict = None, blocks_per_read: int = None,
report_progress: int = None, verbose: int = 1,
compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None)
Description
Veriyi bir giriş veri setinden çıktı veri setine dönüştürür.
Arguments
data
Bir revoscalepy veri kaynak nesnesi, bir veri çerçevesi veya bir .xdf dosyaya giden yol.
output_data
Metin veya xdf dosya adı ya RxDataSource da dönüştürülmüş verileri depolamak için yazma yeteneklerine sahip bir gönderi ver.
Eğer Yoksa, bir veri çerçevesi döner. Varsayılan değer olarak Hiçbiri kullanılır.
üzerine yazmak
Eğer True, var output_data olan bir şey üzerine yazılır; eğer False var olan bir output_data şey üzerine yazılmazsa.
False varsayılan değerdir.
data_threads
Veri boru hattında istenen paralellik derecesini belirten bir tam sayı. Eğer Yoksa, kullanılan iş parçacığı sayısı dahili olarak belirlenir. Varsayılan değer olarak Hiçbiri kullanılır.
random_seed
Rastgele tohumu belirtir. Varsayılan değer olarak Hiçbiri kullanılır.
max_slots
Vektör değerli sütunlar için maksimum yuvalar (<=0 tüm döndürmek için).
ml_transforms
Eğitimden önce veriler üzerinde gerçekleştirilecek MicrosoftML dönüşümlerinin listesini veya hiçbir dönüşüm gerçekleştirilecekse Hiçbiri'ni belirtir. Desteklenen dönüştürmeler için bkz featurize_text. , categoricalve categorical_hash.
Bu dönüştürmeler, belirtilen Python dönüşümlerinden sonra gerçekleştirilir.
Varsayılan değer olarak Hiçbiri kullanılır.
ml_transform_vars
Kullanılacak değişken adlarının karakter vektörlerini veya hiçbiri kullanılmadıysa ml_transformsHiçbiri'ni belirtir.
Varsayılan değer olarak Hiçbiri kullanılır.
row_selection
DESTEKLENMEDİ. Model tarafından veri kümesindeki bir mantıksal değişkenin adıyla (tırnak içinde) veya veri kümesindeki değişkenleri kullanan bir mantıksal ifadeyle kullanılacak satırları (gözlemleri) belirtir. Örneğin:
row_selection = "old"yalnızca değişkenininoldTruedeğerinin olduğu gözlemleri kullanır.row_selection = (age > 20) & (age < 65) & (log(income) > 10)yalnızca değişkenin değerininage20 ile 65 arasında olduğu ve değişkenin değerininlogincome10'dan büyük olduğu gözlemleri kullanır.
Satır seçimi, veri dönüştürmeleri işlendikten sonra gerçekleştirilir (veya bağımsız değişkenlerine transformstransform_functionbakın). Tüm ifadelerde olduğu gibi, row_selection işlevi kullanılarak expression işlev çağrısı dışında tanımlanabilir.
Dönüştüren
DESTEKLENMEDİ. Değişken dönüşümlerinin ilk turunu temsil eden formun ifadesi. Tüm ifadelerde olduğu gibi , transforms (veya row_selection) işlevi kullanılarak expression işlev çağrısı dışında tanımlanabilir.
Varsayılan değer olarak Hiçbiri kullanılır.
transform_objects
DESTEKLENMEDİ. , transformsve transform_functiontarafından row_selectionbaşvurulabilen nesneler içeren adlandırılmış liste. Varsayılan değer olarak Hiçbiri kullanılır.
transform_function
Değişken dönüştürme işlevi. Varsayılan değer olarak Hiçbiri kullanılır.
transform_variables
Dönüştürme işlevi için gereken giriş veri kümesi değişkenlerinin karakter vektörleri. Varsayılan değer olarak Hiçbiri kullanılır.
transform_packages
DESTEKLENMEDİ. Değişken dönüştürme işlevlerinde kullanılmak üzere kullanıma sunulacak ve önceden yüklenecek ek Python paketlerini (içinde RxOptions.get_option("transform_packages")belirtilenlerin dışında) belirten bir karakter vektör.
Örneğin, ve bağımsız değişkenleri aracılığıyla transformstransform_function işlevlerinde açıkça tanımlananlar veya veya bağımsız değişkenleri aracılığıyla formularow_selection örtük olarak tanımlananlar. Bağımsız transform_packages değişken, dışında hiçbir paketin önceden yüklenmediğini gösteren RxOptions.get_option("transform_packages") de olabilir.
transform_environment
DESTEKLENMEDİ. Dahili olarak geliştirilen ve değişken veri dönüşümü için kullanılan tüm ortamların üst öğesi olarak görev yapmak için kullanıcı tanımlı bir ortam.
Eğer transform_environment = None, bunun yerine ana revoscalepy.baseenv ile yeni bir "hash" ortamı kullanılır. Varsayılan değer Yok'tur.
blocks_per_read
Veri kaynağından okunan her veri öbekleri için okunacak blok sayısını belirtir.
report_progress
Satır işleme ilerleme durumuyla ilgili raporlama düzeyini belirten bir tamsayı değeri:
0: herhangi bir ilerleme bildirilmemiştir.1: işlenen satır sayısı yazdırılır ve güncelleştirilir.2: işlenen satırlar ve zamanlamalar bildirilir.3: işlenen satırlar ve tüm zamanlamalar bildirilir.
1 varsayılan değerdir.
verbose
İstenen çıkış miktarını belirten bir tamsayı değeri.
ise 0, hesaplamalar sırasında ayrıntılı çıktı yazdırılmaz. Artan miktarda bilgi sağlamak için 1 olan 4 tamsayı değerleri.
1 varsayılan değerdir.
compute_context
Geçerli bir revoscalepy ile belirtilen hesaplamaların yürütülme bağlamını ayarlar. RxComputeContext. Şu anda yerel ve revoscalepy. RxInSqlServer işlem bağlamları desteklenir.
İadeler
Bir veri çerçevesi veya bir revoscalepy. Oluşturulan çıktı verisini temsil eden RxDataSource nesnesi.
Example
'''
Example with rx_featurize.
'''
import numpy
import pandas
from microsoftml import rx_featurize, categorical
# rx_featurize basically allows you to access data from the MicrosoftML transforms
# In this example we'll look at getting the output of the categorical transform
# Create the data
categorical_data = pandas.DataFrame(data=dict(places_visited=[
"London", "Brunei", "London", "Paris", "Seria"]),
dtype="category")
print(categorical_data)
# Invoke the categorical transform
categorized = rx_featurize(data=categorical_data,
ml_transforms=[categorical(cols=dict(xdatacat="places_visited"))])
# Now let's look at the data
print(categorized)
Çıktı:
places_visited
0 London
1 Brunei
2 London
3 Paris
4 Seria
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0521300
Finished writing 5 rows.
Writing completed.
places_visited xdatacat.London xdatacat.Brunei xdatacat.Paris \
0 London 1.0 0.0 0.0
1 Brunei 0.0 1.0 0.0
2 London 1.0 0.0 0.0
3 Paris 0.0 0.0 1.0
4 Seria 0.0 0.0 0.0
xdatacat.Seria
0 0.0
1 0.0
2 0.0
3 0.0
4 1.0