Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Bu makalede AutoML'nin verileri tahmin eğitimi için nasıl hazırladığı ve yapılandırılabilir veri ayarları açıklanmaktadır. Deneme kurulumu sırasında bu seçenekleri AutoML kullanıcı arabiriminde ayarlayabilirsiniz.
AutoML API'sini kullanarak bu ayarları yapılandırmak için AutoML Python API başvurusuna bakın.
Desteklenen veri özelliği türleri
Yalnızca aşağıda listelenen özellik türleri desteklenir. Örneğin, görüntüler desteklenmez .
Aşağıdaki özellik türleri desteklenir:
- Sayısal (
ByteType,ShortType,IntegerType,LongType,FloatTypeveDoubleType) - Boolean (Boole Mantığı)
- Dize (kategorik veya İngilizce metin)
- Zaman damgaları (
TimestampType,DateType) - ArrayType[Numeric] (Databricks Runtime 10.4 LTS ML ve üzeri)
- DecimalType (Databricks Runtime 11.3 LTS ML ve üzeri)
Eksik değerleri atama
Databricks Runtime 10.4 LTS ML ve üzerinde, null değerlerin nasıl işaretleneceğini belirtebilirsiniz. Kullanıcı arabiriminde, tablo şemasındaki Impute with sütunundaki açılan listeden bir yöntem seçin. API'de parametresini imputers kullanın. Daha fazla bilgi için bkz . AutoML Python API başvurusu.
Varsayılan olarak, AutoML sütun türüne ve içeriğe göre bir imputation yöntemi seçer.
Not
Varsayılan olmayan bir imputation yöntemi belirtirseniz, AutoML anlamsal tür algılaması gerçekleştirmez.
Tahmin verilerini eğitim, doğrulama ve test kümelerine bölme
AutoML, eğitim, doğrulama ve test için verilerinizi üç bölmeye böler.
Tahmin görevleri için AutoML, zaman serisi çapraz doğrulamasını kullanır. Bu yöntem, eğitim veri kümesini kronolojik olarak artımlı olarak genişletir ve sonraki zaman noktalarında doğrulama gerçekleştirir. Çapraz doğrulama, modelin farklı zaman dilimlerine göre performansının sağlam bir değerlendirmesini sağlar. Tahmin modelinin gelecekteki görülmeyen verilere karşı sıkı bir şekilde test edilmesini ve tahminlerin ilgi ve doğruluğunu korumasını sağlar.
Çapraz doğrulama katlamalarının sayısı, zaman serisi sayısı, kovaryatların varlığı ve zaman serisi uzunluğu gibi giriş tablosu özelliklerine bağlıdır.
Zaman serisi toplama
Tahmin sorunları için, bir zaman serisinde bir zaman damgası için birden çok değer olduğunda, AutoML değerlerin ortalamasını kullanır.
Bunun yerine toplamı kullanmak için deneme çalıştırmaları tarafından oluşturulan kaynak kod not defterini düzenleyin. Verileri ... hücresine
group_cols = [time_col] + id_cols
df_aggregation = df_loaded \
.groupby(group_cols) \
.agg(y=(target_col, "sum")) \
.reset_index() \
.rename(columns={ time_col : "ds" })