Apache Spark™ 声明性管道是一个声明性框架,用于在 SQL 和 Python 中生成批处理和流式处理数据管道。 Lakeflow 管道扩展并可与 Spark 声明性管道互操作,同时在性能优化的 Databricks Runtime 上运行。 管道的常见用例包括从云存储(如 Amazon S3、Azure ADLS Gen2 和 Google Cloud Storage)和消息总线(如 Apache Kafka、Amazon Kinesis、Google Pub/Sub、Azure EventHub 和 Apache Pulsar)的数据引入,以及增量批处理和流转换。
注释
Lakeflow 管道需要使用高级套餐。 有关详细信息,请联系 Databricks 帐户团队。
本部分提供有关使用管道的详细信息。 以下主题可帮助你入门。
| 主题 | Description |
|---|---|
| 管道概念 | 了解管道的高级概念,包括流、流式处理表和具体化视图。 |
| 教程 | 按照教程操作,获得使用管道的实际经验。 |
| 开发管道 | 了解如何开发和测试用于创建用于引入和转换数据的流的管道。 |
| 配置管道 | 了解如何计划和配置管道。 |
| 监视流水线 | 了解如何监视管道并对管道查询进行故障排除。 |
| 开发 人员 | 了解如何在开发管道时使用 Python 和 SQL。 |
| 独立管道 | 了解如何在 Databricks SQL 或Python中创建独立的流式处理表和具体化视图。 |
| 最佳实践 | 了解用于生成可靠、高效且可维护的管道的建议模式。 |