Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Dotyczy:
Databricks SQL
Databricks Runtime
Ważna
Ta funkcja jest dostępna w wersji beta. Administratorzy obszaru roboczego mogą kontrolować dostęp do tej funkcji ze strony Podglądy . Zobacz Zarządzanie wersjami zapoznawczami usługi Azure Databricks.
ai_top_drivers() jest funkcją tabelową do analizy wkładu. Klasyfikuje wartości wymiarowe, czyli pary wartości, które najbardziej przyczyniają się do zmiany metryki między grupą kontrolną a grupą testową. Zobacz Argumenty , aby poznać dostępne argumenty.
Wymagania
- Databricks Runtime 16.1 lub nowszy
- Pro lub serwerowy magazyn SQL z włączonym Photon , albo klaster z Photonem w Databricks Runtime
- Zarejestruj swoje miejsce pracy w podglądzie Predictive AI Functions . Zobacz Zarządzanie wersjami zapoznawczami usługi Azure Databricks.
Składnia
ai_top_drivers(input => input, metric => metric, is_test => is_test
[, optional_param ] [...])
optional_param:
{ dimensions => dimensions |
aggregation => aggregation |
min_support => min_support }
Argumenty
Przekażcie wszystkie argumenty po imieniu.
-
inputto dane wejściowe o wartości tabelowej do analizy. Dostarcz tabelę lub podzapytanie z kolumną metryki, kolumnami wymiarów oraz kolumną etykiety testowej. -
metrictoSTRINGnazywanie kolumny liczbowej do analizy. Kolumna musi mieć typ numeryczny. -
is_testtoSTRINGnazwanie kolumny boole'a, która oznacza każdy wiersz.TRUEoznacza podział testowy iFALSEkontrolny. -
dimensions(opcjonalnie) to nazwaARRAY<STRING>kolumn do segmentacji. Kolumny liczbowe o niskiej kardynalności są podzielone na wartości dokładne. Kolumny liczbowe o wysokiej kardynalności są automatycznie grupowane w ,lowmedium, ihighzakresy. Jeśli pominiesz ten argument, funkcja automatycznie wybiera 20 górnych kolumn skorelowanych wymiarów z wejścia. -
aggregation(opcjonalnie) toSTRINGnazwanie agregatu, który ma się stosować wmetrickażdym segmencie. Obsługiwane wartości tosum,avg,count,minimax. Wartość domyślna tosum. -
min_support(opcjonalnie) to przedziałDOUBLEmiędzy 0 a 1, reprezentujący minimalny ułamek analizowalnych wierszy, które segment musi pokryć, aby pojawić się w wynikach. Wartość domyślna to0.05.
Zwroty
Funkcja zwraca tabelę z następującymi kolumnami:
-
contributor: ToARRAY<STRING>opisuje ten segment. Każdy element używa formycolumn=value, na przykład["pickup_zip=high (>10044)"]lub["pickup_zip=high (>10044)", "payment_type=CRD"]. -
metric_control: Zagregowana metryka dla segmentu w grupie kontrolnej (is_test=FALSE). -
metric_test: Zagregowana metryka dla segmentu w grupie testowej (is_test=TRUE). -
change: Absolutna różnica,metric_test−metric_control. -
relative_change: Zmiana jako ułamekmetric_control. -
support: Ułamek wszystkich analizowalnych wierszy w segmencie.
Wyniki obejmują współtwórców jednowymiarowych, pary wartości wymiarowych oraz ["all"] wiersz podsumowujący całą populację.
Examples
Poniższy przykład porównuje całkowite przychody z opłat w okresie od stycznia do lutego 2016 roku i wskazuje zakresy kodów pocztowych odbioru, które najbardziej przyczyniają się do zmiany:
WITH input AS (
SELECT
pickup_zip,
fare_amount,
CASE
WHEN DATE(tpep_pickup_datetime) BETWEEN '2016-01-01' AND '2016-01-31' THEN false
WHEN DATE(tpep_pickup_datetime) BETWEEN '2016-02-01' AND '2016-02-29' THEN true
ELSE NULL
END AS is_test
FROM samples.nyctaxi.trips
WHERE DATE(tpep_pickup_datetime) BETWEEN '2016-01-01' AND '2016-02-29'
)
SELECT *
FROM ai_top_drivers(
input => TABLE(input),
metric => 'fare_amount',
is_test => 'is_test',
dimensions => ARRAY('pickup_zip'),
aggregation => 'sum'
)
ORDER BY ABS(change) DESC
Poniższy przykład liczy przejazdy w zakresie kodów pocztowych w tych samych okresach:
WITH input AS (
SELECT
dropoff_zip,
1 AS trip_count,
CASE
WHEN DATE(tpep_pickup_datetime) BETWEEN '2016-01-01' AND '2016-01-31' THEN false
WHEN DATE(tpep_pickup_datetime) BETWEEN '2016-02-01' AND '2016-02-29' THEN true
ELSE NULL
END AS is_test
FROM samples.nyctaxi.trips
WHERE DATE(tpep_pickup_datetime) BETWEEN '2016-01-01' AND '2016-02-29'
)
SELECT *
FROM ai_top_drivers(
input => TABLE(input),
metric => 'trip_count',
is_test => 'is_test',
dimensions => ARRAY('dropoff_zip'),
aggregation => 'count'
)
ORDER BY ABS(change) DESC
Note
Do count agregacji należy podać kolumnę liczbową do liczenia. Stała kolumna taka jak jest 1 AS trip_count wzorcem powszechnym.
Ograniczenia
Podczas bety obowiązują następujące ograniczenia:
- Wiersze z wartością
NULLw kolumniemetricoris_testsą usuwane przed analizą. -
count distinctamedianagregaty nie są wspierane. -
MAPSTRUCTa kolumny wymiarowe nie są podtrzymywane. Identyfikatory numeryczne, takie jak kody pocztowe i ID, traktowane są jako wielkości i mogą być grupowane w zakresy. Rzuć identyfikatory numeryczne doSTRINGsegmentacji według dokładnej wartości.