Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Şunlar için geçerlidir:
SQL Server 2019 ve önceki Analysis Services
Azure Analysis Services
Fabric/Power BI Premium
Önemli
Veri madenciliği SQL Server 2017 Analysis Services'da kullanım dışı bırakıldı ve artık SQL Server 2022 Analysis Services'da sonlandırıldı. Kullanım dışı bırakılan ve kullanımdan kaldırılan özellikler için belgeler güncelleştirilmez. Daha fazla bilgi edinmek için bkz. Analysis Services eski sürüm uyumluluğu.
Verileri eğitim ve test kümelerine ayırmak, veri madenciliği modellerini değerlendirmenin önemli bir parçasıdır. Genellikle, bir veri kümesini eğitim kümesine ve test kümesine ayırdığınızda, verilerin çoğu eğitim için kullanılır ve verilerin daha küçük bir kısmı test için kullanılır. SQL Server Analysis Services, test ve eğitim kümelerinin benzer olduğundan emin olmak için verileri rastgele örnekler. Eğitim ve test için benzer verileri kullanarak veri tutarsızlıklarının etkilerini en aza indirip modelin özelliklerini daha iyi anlayabilirsiniz.
Eğitim kümesi kullanılarak bir model işlendikten sonra, test kümesinde tahminler yaparak modeli test edebilirsiniz. Test kümesindeki veriler önceden tahmin etmek istediğiniz özniteliğin bilinen değerlerini içerdiğinden, modelin tahminlerinin doğru olup olmadığını belirlemek kolaydır.
Veri Madenciliği Yapıları için Test ve Eğitim Kümeleri Oluşturma
SQL Server 2017'de, özgün veri kümesini madencilik yapısı düzeyinde ayırırsınız. Eğitim ve test veri kümelerinin boyutu ve hangi satırın hangi kümeye ait olduğu hakkındaki bilgiler yapıyla birlikte depolanır ve bu yapıyı temel alan tüm modeller eğitim ve test için kümeleri kullanabilir.
Bir madencilik yapısında test veri kümesini aşağıdaki yollarla tanımlayabilirsiniz:
Veri Madenciliği Sihirbazı'nı kullanarak veri madenciliği yapısını oluşturduğunuzda bölmek için.
Veri Madenciliği Tasarımcısı'nın Madencilik Yapısı sekmesinde yapı özelliklerini değiştirme.
Analysis Management Objects (AMO) veya XML Data Definition Language (DDL) kullanarak yapıları program aracılığıyla oluşturma ve değiştirme.
Bir Madencilik Yapısını Bölmek için Veri Madenciliği Sihirbazı'nı Kullanma
Varsayılan olarak, bir araştırma yapısı için veri kaynaklarını tanımladıktan sonra, Veri Madenciliği Sihirbazı verileri iki kümeye böler: biri kaynak verilerin yüzde 70'ini, modeli eğitme ve diğeri de modeli test etme amacıyla kaynak verilerin yüzde 30'unu içerir. Bu varsayılan değer, genellikle veri madenciliğinde 70-30 oranında kullanıldığından seçilmiştir, ancak SQL Server Analysis Services ile bu oranı gereksinimlerinize uyacak şekilde değiştirebilirsiniz.
Sihirbazı, belirli bir maksimum durumda maksimum eğitim vakası sayısını ayarlamak veya belirtilen maksimum vakaya kadar bir yüzdelik sınırı birleştirerek izin vermek için de yapılandırabilirsiniz. Hem en yüksek vaka yüzdesini hem de en fazla vaka sayısını belirttiğinizde, SQL Server Analysis Services test kümesinin boyutu olarak iki sınırın daha küçük olanını kullanır. Örneğin, test çalışmaları için yüzde 30 bekleme ve maksimum test çalışması sayısını 1000 olarak belirtirseniz, test kümesinin boyutu hiçbir zaman 1000 vakayı aşamaz. Modele daha fazla eğitim verisi eklense bile test kümenizin boyutunun tutarlı kalmasını sağlamak istiyorsanız bu yararlı olabilir.
Farklı madencilik yapıları için aynı veri kaynağı görünümünü kullanıyorsanız ve verilerin tüm madencilik yapıları ve modelleri için kabaca aynı şekilde bölündüğünden emin olmak istiyorsanız, rastgele örneklemeyi başlatmak için kullanılan tohumu belirtmeniz gerekir. HoldoutSeed için bir değer belirttiğinizde, SQL Server Analysis Services örneklemeye başlamak için bu değeri kullanır. Aksi takdirde örnekleme, tohum değerini oluşturmak için madencilik yapısının adında bir karma algoritması kullanır.
Uyarı
EXPORT ve IMPORT deyimlerini kullanarak madencilik yapısının bir kopyasını oluşturursanız, dışarı aktarma işlemi yeni bir kimlik oluşturduğundan ancak aynı adı kullandığından yeni madencilik yapısı aynı eğitim ve test veri kümelerine sahip olur. Ancak, iki araştırma yapısı aynı temel veri kaynağını kullanıyor ancak farklı adlara sahipse, her bir madencilik yapısı için oluşturulan kümeler farklı olacaktır.
Test Veri Kümesi Oluşturmak için Yapı Özelliklerini Değiştirme
Bir madencilik yapısı oluşturup işlerseniz ve daha sonra bir test veri kümesini ayırmak istediğinize karar verirseniz, madencilik yapısının özelliklerini değiştirebilirsiniz. Verilerin bölümlenme biçimini değiştirmek için aşağıdaki özellikleri düzenleyin:
| Mülkiyet | Description |
|---|---|
| HoldoutMaxCases | Test setine dahil edilecek en fazla vaka sayısını belirtir. |
| Holdoutmaxpercent | Test veri kümesine, tam veri kümesinin yüzdesi olarak dahil edilecek vakaların sayısını belirtir. Veri kümesi olmaması için 0 değerini belirtmeniz gerekir. |
| Holdoutseed | Bölümler için verileri rastgele seçerken, tohum olarak kullanılacak bir tamsayı değeri belirtir. Bu değer eğitim kümesindeki vaka sayısını etkilemez; bunun yerine, bölmenin yinelenebilir olmasını sağlar. |
Bir test veri kümesini mevcut bir yapıya ekler veya değiştirirseniz, yapıyı ve ilişkili tüm modelleri yeniden işlemeniz gerekir. Ayrıca kaynak verileri bölmek modelin verilerin farklı bir alt kümesinde eğitilmesine neden olduğundan modelinizden farklı sonuçlar görebilirsiniz.
Bekletmeyi Program Aracılığıyla Belirtme
DMX deyimleri, AMO veya XML DDL kullanarak bir madencilik yapısında test ve eğitim veri kümeleri tanımlayabilirsiniz. ALTER MINING STRUCTURE komutu, bekleme parametrelerinin kullanımını desteklemez.
DMX Veri Madenciliği Uzantıları (DMX) dilinde CREATE MINING STRUCTURE deyimi, WITH HOLDOUT yan tümcesi içerecek şekilde genişletilmiştir..
ASSL SQL Server Analysis Services Betik Oluşturma Dili'ni (ASSL) kullanarak yeni bir madencilik yapısı oluşturabilir veya mevcut bir madencilik yapısına test veri kümesi ekleyebilirsiniz.
AMO Ayrıca, AMO kullanarak ayrı tutma veri kümelerini görüntüleyebilir ve değiştirebilirsiniz.
Veri madenciliği şeması satır kümesini sorgulayarak mevcut bir madencilik yapısındaki ayrılmış veri kümesi hakkındaki bilgileri görüntüleyebilirsiniz. Bunu yapmak için DISCOVER ROWSET çağrısı yapabilir veya bir DMX sorgusu kullanabilirsiniz.
Hedef Veriler hakkında Bilgi Edinme
Varsayılan olarak, yeni modelleri eğitmek ve test etmek için mevcut verileri kullanabilmeniz için eğitim ve test veri kümelerine ilişkin tüm bilgiler önbelleğe alınır. Ayrıca, modeli veri alt kümelerinde değerlendirebilmeniz için önbelleğe alınmış tutma verilerine uygulanacak filtreler de tanımlayabilirsiniz.
Vaka dosyalarının eğitim ve test veri kümelerine ayrılma şekli, hold-out yöntemini nasıl yapılandırdığınıza ve sağladığınız verilere bağlıdır. Eğitim veya test için kullanılan servis talebi sayısını belirlemek veya eğitim ve test kümelerine dahil edilen servis talepleri hakkında ek ayrıntılar bulmak istiyorsanız, bir DMX sorgusu oluşturarak model yapısını sorgulayabilirsiniz. Örneğin, aşağıdaki sorgu modelin eğitim kümesinde kullanılan durumları döndürür.
SELECT * from <structure>.CASES WHERE IsTrainingCase()
Yalnızca test vakalarını almak ve ayrıca madencilik yapısındaki sütunlardan birinde test vakalarını filtrelemek için aşağıdaki sözdizimini kullanın:
SELECT * from <structure>.CASES WHERE IsTestCase() AND <structure column name> = '<value>'
Ayrılmış Verinin Kullanımıyla İlgili Sınırlamalar
Holdout'u kullanmak için, MiningStructureCacheMode madencilik yapısının özelliği varsayılan değer olan KeepTrainingCases olarak ayarlanmalıdır. Eğer CacheMode özelliğini ClearAfterProcessing olarak değiştirir ve ardından madencilik yapısını yeniden işlerseniz, bölüm kaybolur.
Zaman serisi modelinden veri kaldıramazsınız; bu nedenle, kaynak verileri eğitim ve test kümelerine ayıramazsınız. Bir madencilik yapısı ve modeli oluşturmaya başlar ve Microsoft Zaman Serisi algoritmasını seçerseniz, bekletme veri kümesi oluşturma seçeneği devre dışı bırakılır. Madencilik yapısı olgu veya iç içe tablo düzeyinde bir KEY TIME sütunu içeriyorsa, tutulan verilerin kullanımı da devre dışı bırakılır.
Bekleme veri kümesini, test için tüm veri kümesinin kullanılıp eğitim için veri kalmayacak şekilde yanlışlıkla yapılandırmak mümkündür. Ancak, bunu yaparsanız, SQL Server Analysis Services sorunu düzeltebilmeniz için bir hata oluşturur. Sql Server Analysis Services ayrıca verilerin yüzde 50'sinden fazlası test için tutulduysa yapı işlendiğinde sizi uyarır.
Çoğu durumda, varsayılan 30 saklama değeri eğitim ve test verileri arasında iyi bir denge sağlar. Yeterli eğitim sağlamak için veri kümesinin ne kadar büyük olması gerektiğini veya eğitim kümesinin ne kadar seyrek olabileceğini belirlemenin ve yine de fazla uygunluktan kaçınmanın basit bir yolu yoktur. Ancak, bir model derledikten sonra, veri kümesini belirli bir modelle ilgili olarak değerlendirmek için çapraz doğrulamayı kullanabilirsiniz.
Önceki tabloda listelenen özelliklere ek olarak, AMO ve XML DDL'de holdoutActualSize adlı salt okunur bir özellik sağlanır. Ancak, bir bölümün gerçek boyutu, yapı işleninceye kadar doğru belirlenemediğinden, HoldoutActualSize özelliğinin değerini almadan önce modelin işlenip işlenmediğini denetlemeniz gerekir.
Ayrıca Bkz.
Veri Madenciliği Araçları
Veri Madenciliği Kavramları
Veri Madenciliği Çözümleri
Test ve Doğrulama (Veri Madenciliği)