지정된 표준 수준을 사용하여 부동 벡터를 단위 길이로 정규화합니다. 지정되지 않은 경우 도 기본값은 2.0(유클리드 표준)입니다.
해당 Databricks SQL 함수에 대해 알아보려면 vector_normalize 함수를 참조하세요.
Syntax
from pyspark.sql import functions as dbf
dbf.vector_normalize(vector=<vector>, degree=<degree>)
Parameters
| 매개 변수 | Type | 설명 |
|---|---|---|
vector |
pyspark.sql.Column 또는 열 이름 |
입력 벡터 열입니다. |
degree |
pyspark.sql.Column 또는 열 이름, 선택 사항 |
표준 수준(1.0 L1의 경우 L2 2.0 , float('inf') 무한대 표준의 경우). 기본값은 2.0입니다. |
Returns
pyspark.sql.Column: 부동 소수 자릿수 배열로 정규화된 벡터입니다.
예제
from pyspark.sql import functions as dbf
from pyspark.sql.types import ArrayType, FloatType, StructType, StructField
schema = StructType([StructField('v', ArrayType(FloatType()))])
df = spark.createDataFrame([([3.0, 4.0],)], schema)
df.select(dbf.vector_normalize('v', dbf.lit(2.0).cast('float'))).first()[0]
# [0.6..., 0.8...]