regexp_substr

Vrátí první podřetězce, který odpovídá regulárnímu výrazu regexp Java v řetězci str. Pokud se regulární výraz nenajde, výsledek je null.

Odpovídající funkci SQL Databricks vizte funkceregexp_substr.

Syntaxe

from pyspark.sql import functions as dbf

dbf.regexp_substr(str=<str>, regexp=<regexp>)

Parametry

Parameter Typ Description
str pyspark.sql.Column nebo str cílový sloupec, na který se má pracovat.
regexp pyspark.sql.Column nebo str vzor regulárního výrazu, který se má použít.

Examples

from pyspark.sql import functions as dbf
df = spark.createDataFrame([("1a 2b 14m", r"\d+")], ["str", "regexp"])
df.select('*', dbf.regexp_substr('str', dbf.lit(r'\d+'))).show()
df.select('*', dbf.regexp_substr('str', dbf.lit(r'mmm'))).show()
df.select('*', dbf.regexp_substr("str", dbf.col("regexp"))).show()
df.select('*', dbf.regexp_substr(dbf.col("str"), "regexp")).show()