Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
DataFrame'de adlandırılmış ölçümleri gözlemlemek için bir sınıf.
Ölçümler, bir eylem tarafından işlenirken DataFrame'e uygulanan toplama ifadeleridir. İlk eylem yürütülürken Gözlem örneği ölçümleri toplar. Sonraki eylemler tarafından Observation.getdöndürülen ölçümleri değiştirmez. İlk eylem tamamlanana ve ölçümler kullanılabilir duruma gelene kadar ölçümün bloklar aracılığıyla Observation.get alınması.
Sözdizimi
from pyspark.sql import Observation
observation = Observation(name=<name>)
Parametreler
| Parametre | Türü | Açıklama |
|---|---|---|
name |
str, isteğe bağlı | Gözlemin adı ve ölçümü. Varsayılan olarak rastgele bir UUID dizesi kullanır. |
Özellikler
| Mülkiyet | Açıklama |
|---|---|
get |
Gözlemlenen ölçümleri sözlük olarak döndürür. Gözlemlenen veri kümesinin ilk eylemini bitirmesini bekler. Yalnızca ilk eylemin sonucu kullanılabilir. |
Notlar
Bu sınıf akış veri kümelerini desteklemez.
Ölçüm sütunları değişmez değer (örneğin), lit(42)veya bir veya daha fazla toplama işlevi (örneğin, sum(a) veya sum(a + b) + avg(c) - lit(1)) içermelidir. DataFrame'in giriş sütunlarına başvurular içeren ifadeler her zaman bir toplama işlevinde sarmalanmalıdır.
Örnekler
from pyspark.sql.functions import col, count, lit, max
from pyspark.sql import Observation
df = spark.createDataFrame([["Alice", 2], ["Bob", 5]], ["name", "age"])
observation = Observation("my metrics")
observed_df = df.observe(observation, count(lit(1)).alias("count"), max(col("age")))
observed_df.count()
2
observation.get
{'count': 2, 'max(age)': 5}