Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Le text format lit chaque ligne d’un fichier texte sous forme de ligne dans un DataFrame avec une seule value colonne de type StringType. Les utilisateurs d’Azure Databricks l’utilisent généralement pour l’analyse des journaux, l’ingestion de données brutes avant un traitement ultérieur, ou pour tout flux de travail nécessitant un accès ligne par ligne au contenu du fichier. Azure Databricks prend en charge la lecture et l’écriture de fichiers texte avec Apache Spark, y compris la compression d’écriture.
Prerequisites
Azure Databricks ne nécessite pas de configuration supplémentaire pour utiliser des fichiers texte. Toutefois, pour diffuser en continu des fichiers texte, vous avez besoin d’un chargeur automatique.
Options
Utilisez les méthodes .option() et .options() de DataFrameReader et DataFrameWriter pour configurer des sources de données texte. Pour obtenir la liste complète des options prises en charge, consultez DataFrameReader options de texte et DataFrameWriter options de texte.
Utilisation
Les exemples suivants utilisent le jeu de données Wanderbricks pour illustrer la lecture et l’écriture de fichiers texte à l’aide de l’API DataFrame Spark et de SQL.
Lire des fichiers texte à l’aide de SQL
Pour interroger des fichiers texte sans inscrire une table, utilisez read_files. Les autorisations du catalogue Unity sur l’emplacement externe s’appliquent automatiquement.
SELECT * FROM read_files(
'/Volumes/<catalog>/<schema>/<volume>/review_comments',
format => 'text'
)
Lire et écrire des fichiers texte
Le text format nécessite un DataFrame avec une seule StringType colonne. Les exemples suivants enregistrent des commentaires d’évaluation Wanderbricks dans un fichier texte, puis les relisent.
Python
from pyspark.sql.functions import col
# Write wanderbricks review comments as a text file
df = spark.read.table("samples.wanderbricks.reviews").select(col("comment").alias("value"))
df.write.format("text").save("/Volumes/<catalog>/<schema>/<volume>/review_comments")
# Read a text file — each line becomes a row in the "value" column
df = spark.read.format("text").load("/Volumes/<catalog>/<schema>/<volume>/review_comments")
display(df)
Scala
import org.apache.spark.sql.functions.col
// Write wanderbricks review comments as a text file
val df = spark.read.table("samples.wanderbricks.reviews").select(col("comment").alias("value"))
df.write.format("text").save("/Volumes/<catalog>/<schema>/<volume>/review_comments")
// Read a text file — each line becomes a row in the "value" column
val text = spark.read.format("text").load("/Volumes/<catalog>/<schema>/<volume>/review_comments")
text.show()
Ressources additionnelles
- Lire et écrire des fichiers CSV : si vos données texte sont délimitées ou tabulaires, CSV fournit une analyse structurée avec l’inférence de schéma, la prise en charge de l’en-tête et les délimiteurs configurables.