Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfada Spark için bir Python API'si olan PySpark'a yönelik başvuruya genel bir bakış sağlanmaktadır. PySpark hakkında daha fazla bilgi için bkz. Azure Databricks üzerinde
Veri türleri
PySpark veri türlerinin tam listesi için bkz. PySpark veri türleri.
Sınıflar
Veri Çerçeveleri
| Reference | Description |
|---|---|
| Sütun | Dönüştürmeler ve ifadeler de dahil olmak üzere DataFrame sütunlarıyla çalışmaya yönelik işlemler. |
| DataFrame | İlişkisel veritabanındaki bir tabloya benzer şekilde adlandırılmış sütunlar halinde düzenlenmiş dağıtılmış veri koleksiyonu. |
| DataFrameNaFunctions | DataFrame'de eksik verilerle çalışma işlevselliği. |
| DataFrameReader | Dış depolama sistemlerinden DataFrame yüklemek için kullanılan arabirim. |
| DataFrameStatFunctions | DataFrame ile istatistiksel işlevler için işlevsellik. |
| DataFrameWriter | Dış depolama sistemlerine DataFrame yazmak için kullanılan arabirim. |
| DataFrameWriterV2 | Dış depolamaya DataFrame yazmak için kullanılan arabirim (sürüm 2). |
| GroupedData | Verileri gruplandırma ve gruplandırılmış DataFrame'lerde toplama işlemleri gerçekleştirme yöntemleri. |
| Sıra | Tek tek alan değerlerine erişim sağlayarak DataFrame'deki bir veri satırını temsil eder. |
Özel veri kaynakları
| Reference | Description |
|---|---|
| Veri Kaynağı | Dış sistemlerden okunacak özel veri kaynaklarını uygulamaya yönelik API'ler. Özel veri kaynakları hakkında bilgi için bkz. PySpark özel veri kaynakları. |
| DataSourceArrowWriter | PyArrow'un RecordBatchkullanarak verileri işleyen veri kaynağı yazarları için bir temel sınıf. |
| DataSourceRegistration | Veri kaynağı kaydı için sarmalayıcı. |
| DataSourceReader | Veri kaynağı okuyucuları için temel sınıf. |
| DataSourceStreamArrowWriter | PyArrow'un RecordBatchkullanarak verileri işleyen veri akışı yazarları için temel sınıf. |
| DataSourceStreamReader | Akış veri kaynağı okuyucuları için temel sınıf. |
| DataSourceStreamWriter | Veri akışı yazarları için temel sınıf. |
| DataSourceWriter | Verileri toplu iş modunda özel bir veri kaynağına kaydetmekle sorumlu veri kaynağı yazarları için temel sınıf. |
| InputPartition | yöntemi partitions()tarafından DataSourceReader döndürülen giriş bölümünü temsil eden bir temel sınıf. |
| SimpleDataSourceStreamReader | Verileri okuyan ve en son uzaklığı aynı anda planlayan basitleştirilmiş akış veri kaynağı okuyucuları için temel sınıf. |
| WriterCommitMessage | tarafından DataSourceWriter.write döndürülen ve veya DataSourceWriter.commitgiriş parametresi DataSourceWriter.abort olarak sürücüye geri gönderilen bir işleme iletisi. |
Yapılandırılmış Akış
| Reference | Description |
|---|---|
| DataStreamReader | Dış depolama sistemlerinden akış DataFrame yüklemek için kullanılan arabirim. |
| DataStreamWriter | Dış depolama sistemlerine akış DataFrame yazmak için kullanılan arabirim. |
| Durum Bilgisi Olan İşlemci | Yapılandırılmış akışta, karmaşık durum bilgisine sahip işlemler için akış içindeki toplu işlemlerin durumunu yönetir. |
| StreamingQuery | Yeni veriler geldikçe arka planda sürekli olarak yürütülen bir sorgu tanıtıcısı. |
| StreamingQueryListener | Sorgu yaşam döngüsü olaylarının akışını dinlemek için soyut sınıf. |
| StreamingQueryManager | ile StreamingQueryilişkili tüm etkin SparkSession örnekleri yönetir. |
Kullanıcı tanımlı işlevler
| Reference | Description |
|---|---|
| UserDefinedFunction (UDF) | DataFrame sütunlarına özel Python mantığı uygulamak için kullanıcı tanımlı işlevler. |
| UDFRegistration | Kullanıcı tanımlı işlev kaydı için sarmalayıcı. Bu örneğe tarafından spark.udferişilebilir. |
| UserDefinedTableFunction (UDTF) | Her giriş satırı için birden çok satır döndüren kullanıcı tanımlı tablo işlevleri. |
| UDTFRegistration | Kullanıcı tanımlı tablo işlevi kaydı için sarmalayıcı. Bu örneğe tarafından spark.udtferişilebilir. |
Diğer temel sınıflar
| Reference | Description |
|---|---|
| Katalog | Veritabanlarını, tabloları, işlevleri ve diğer katalog meta verilerini yönetme arabirimi. |
| Coğrafya | Python coğrafya değerini temsil eden bir sınıf. |
| Geometri | Python geometri değerini temsil eden bir sınıf. |
| Gözlem | İzleme ve hata ayıklama için ölçümleri toplar ve sorgu yürütme sırasında DataFrame'leri gözlemler. |
| PlotAccessor | PySpark'ta DataFrame çizim işlevselliği için erişimci. |
| ProtoBuf | Protokol Buffers formatını kullanarak verilerin serileştirilmesi ve seriden çıkarılması desteği. |
| RuntimeConfig | Yürütme ve iyileştirici ayarları da dahil olmak üzere Spark SQL için çalışma zamanı yapılandırma seçenekleri. Yalnızca Databricks'te kullanılabilen yapılandırma hakkında bilgi için bkz. Spark yapılandırma özelliklerini Azure Databricks üzerinde ayarlama. |
| SparkSession | PySpark uygulamalarında verileri okumak ve SQL sorguları yürütmek için giriş noktası. |
| VariantVal | Dinamik türleri ve iç içe yapıları destekleyen esnek şema ile yarı yapılandırılmış verileri temsil eder. |
| Pencere | Geçerli satırla ilgili bir tablo satırları kümesinde hesaplamalar yapmak için pencere işlevleri. |
| WindowSpec | Geçerli satırla ilgili bir tablo satırları kümesinde hesaplamalar yapmak için pencere işlevleri. |
Functions
Kullanılabilir yerleşik işlevlerin tam listesi için bkz. PySpark işlevleri.