Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Оболочка для регистрации источника данных.
Доступ к этому экземпляру можно получить через spark.dataSource. Используйте его для регистрации пользовательского DataSource подкласса, чтобы на него можно ссылаться по имени и spark.read.format()df.write.format().
Синтаксис
spark.dataSource.register(MyDataSource)
Методы
| Метод | Описание |
|---|---|
register(dataSource) |
Регистрирует определяемый пользователем источник данных Python.
dataSource должен быть подклассом DataSource. |
Примеры
Зарегистрируйте пользовательский источник данных и считывает из него:
from pyspark.sql.datasource import DataSource, DataSourceReader
class MyDataSource(DataSource):
@classmethod
def name(cls):
return "my_data_source"
def schema(self):
return "id INT, value STRING"
def reader(self, schema):
return MyDataSourceReader(schema)
class MyDataSourceReader(DataSourceReader):
def read(self, partition):
yield (1, "hello")
yield (2, "world")
spark.dataSource.register(MyDataSource)
df = spark.read.format("my_data_source").load()
df.show()