rxFastForest: Fast Forest

아티클
05/23/2023

기계 학습 Fast Forest

사용

  rxFastForest(formula = NULL, data, type = c("binary", "regression"),
    numTrees = 100, numLeaves = 20, minSplit = 10, exampleFraction = 0.7,
    featureFraction = 0.7, splitFraction = 0.7, numBins = 255,
    firstUsePenalty = 0, gainConfLevel = 0, trainThreads = 8,
    randomSeed = NULL, mlTransforms = NULL, mlTransformVars = NULL,
    rowSelection = NULL, transforms = NULL, transformObjects = NULL,
    transformFunc = NULL, transformVars = NULL, transformPackages = NULL,
    transformEnvir = NULL, blocksPerRead = rxGetOption("blocksPerRead"),
    reportProgress = rxGetOption("reportProgress"), verbose = 2,
    computeContext = rxGetOption("computeContext"),
    ensemble = ensembleControl(), ...)

인수

`formula`

rxFormula에서 설명된 수식입니다. 상호 작용 용어와 F()는 현재 MicrosoftML에서 지원되지 않습니다.

`data`

.xdf 파일 또는 데이터 프레임 개체를 지정하는 데이터 원본 개체 또는 문자열입니다.

`type`

Fast Tree 형식을 나타내는 문자열:

기본 Fast Tree 이진 분류의 경우 "binary"
Fast Tree 회귀의 경우 "regression"

`numTrees`

ensemble에서 만들 의사 결정 트리의 총 수를 지정합니다. 더 많은 의사 결정 트리를 만들면 적용 범위가 확대될 수 있지만 학습 시간이 늘어나게 됩니다. 기본값은 100입니다.

`numLeaves`

임의의 트리에서 만들 수 있는 리프(터미널 노드)의 최대 개수. 값이 클수록 트리의 크기가 증가하고 정밀도가 향상될 수 있지만, 과잉 맞춤으로 인해 학습 시간이 길어질 위험이 있습니다. 기본값은 20입니다.

`minSplit`

리프를 만드는 데 필요한 최소 학습 인스턴스 수. 즉, 하위 샘플링된 데이터 중 회귀 트리의 리프에서 허용되는 최소 문서 수입니다. ‘분할’은 트리(노드)의 각 수준에 있는 기능이 임의로 분할됨을 의미합니다. 기본값은 10입니다.

`exampleFraction`

각 트리에 사용할 임의로 선택된 인스턴스의 비율. 기본값은 0.7입니다.

`featureFraction`

각 트리에 사용할 임의로 선택된 기능의 비율. 기본값은 0.7입니다.

`splitFraction`

각 분할에 사용할 임의로 선택된 기능의 비율. 기본값은 0.7입니다.

`numBins`

기능당 고유한 값(bin)의 최대 개수. 기본값은 255입니다.

`firstUsePenalty`

이 기능은 먼저 페널티 계수를 사용합니다. 기본값은 0입니다.

`gainConfLevel`

트리 맞춤 신뢰도 얻기 요구 사항([0,1) 범위에 있어야 함). 기본값은 0입니다.

`trainThreads`

학습에 사용할 스레드의 수. NULL이 지정된 경우 사용할 스레드 수가 내부적으로 결정됩니다. 기본값은 NULL입니다.

`randomSeed`

임의의 시드를 지정합니다. 기본값은 NULL입니다.

`mlTransforms`

학습 전에 데이터에서 수행할 MicrosoftML 변환 목록을 지정하거나 수행할 변환이 없는 경우 NULL을 지정합니다. 지원되는 변환에 관해서는 featurizeText, categorical, categoricalHash를 참조하세요. 이러한 변환은 지정된 R 변환 후에 수행됩니다. 기본값은 NULL입니다.

`mlTransformVars`

mlTransforms에 사용할 변수 이름의 문자 벡터를 지정하거나 사용할 변수가 없는 경우 NULL을 지정합니다. 기본값은 NULL입니다.

`rowSelection`

데이터 세트의 논리 변수 이름(따옴표) 또는 데이터 세트의 변수를 사용하는 논리 식으로 모델에서 사용할 데이터 세트의 행(관찰)을 지정합니다. 예를 들어, rowSelection = "old"는 old 변수의 값이 TRUE인 관찰만 사용합니다. rowSelection = (age > 20) & (age < 65) & (log(income) > 10)은 age 변수의 값이 20에서 65 사이이고 income 변수의 log 값이 10보다 큰 관찰만 사용합니다. 행 선택은 데이터 변환을 처리한 후 수행됩니다(인수 transforms 또는 transformFunc 참조). 모든 식과 마찬가지로 expression 함수를 사용하여 함수 호출 외부에서 rowSelection을 정의할 수 있습니다.

`transforms`

변수 변환의 첫 번째 반올림을 나타내는 list(name = expression, ``...) 양식의 식입니다. 모든 식과 마찬가지로 expression 함수를 사용하여 함수 호출 외부에서 transforms(또는 rowSelection)를 정의할 수 있습니다.

`transformObjects`

transforms, transformsFunc, rowSelection에서 참조할 수 있는 개체를 포함하는 명명된 목록입니다.

`transformFunc`

변수 변환 함수입니다. 자세한 내용은 rxTransform을 참조하세요.

`transformVars`

변환 함수에 필요한 입력 데이터 세트 변수의 문자 벡터입니다. 자세한 내용은 rxTransform을 참조하세요.

`transformPackages`

사용 가능하게 하고 변수 변환 함수에서 사용하도록 미리 로드할 추가 R 패키지(rxGetOption("transformPackages")에 지정된 패키지 외부)를 지정하는 문자 벡터입니다. 예를 들어, transforms 및 transformFunc 인수를 통해 RevoScaleR 함수에 명시적으로 정의되거나 formula 또는 rowSelection 인수를 통해 암시적으로 정의됩니다. transformPackages 인수는 NULL일 수도 있으며, 이는 rxGetOption("transformPackages") 외부의 패키지가 미리 로드되지 않음을 나타냅니다.

`transformEnvir`

내부적으로 개발되어 변수 데이터 변환에 사용되는 모든 환경의 부모 역할을 하는 사용자 정의 환경입니다. transformEnvir = NULL인 경우 부모 baseenv()가 있는 새 “해시” 환경이 대신 사용됩니다.

`blocksPerRead`

데이터 원본에서 읽은 데이터의 각 청크에 대해 읽을 블록 수를 지정합니다.

`reportProgress`

행 처리 진행률에 대한 보고 수준을 지정하는 정수 값입니다.

0: 진행률을 보고하지 않습니다.
1: 처리된 행 수가 출력되고 업데이트됩니다.
2: 처리된 행 및 타이밍이 보고됩니다.
3: 처리된 행 및 모든 타이밍이 보고됩니다.

`verbose`

원하는 출력의 양을 지정하는 정수 값입니다. 0이면 계산 중에 자세한 정보가 출력되지 않습니다. 1에서 4 사이의 정수 값은 더 많은 양의 정보를 제공합니다.

`computeContext`

유효한 RxComputeContext로 지정되었으며 계산이 실행되는 컨텍스트를 설정합니다. 현재 로컬 및 RxInSqlServer 컴퓨팅 컨텍스트가 지원됩니다.

`ensemble`

앙상블을 위한 제어 매개 변수입니다.

`...`

Microsoft 컴퓨팅 엔진에 직접 전달할 추가 인수입니다.

세부 정보

의사 결정 트리는 입력에 일련의 간단한 테스트를 수행하는
비파라메트릭 모델입니다. 이 의사 결정 절차는 입력이 처리 중인 인스턴스와 유사했던 학습 데이터 세트에 있는 출력에 매핑됩니다. 적절한 리프 노드에 도달하고 출력 결정이 반환될 때까지 트리의 분기를 통해 각 인스턴스를 재귀적으로 매핑하는 유사성 측정값에 따라 이진 트리 데이터 구조의 각 노드에서 의사 결정이 이루어집니다.

의사 결정 트리를 사용하는 경우의 몇 가지 이점은 다음과 같습니다.

학습 및 예측 중에 계산과 메모리 사용량 측면에서 모두 효율적입니다.

비선형 의사 결정 경계를 표시할 수 있습니다.

통합 기능 선택 및 분류를 수행합니다.

잡음 기능이 있는 경우 탄력적입니다.

Fast Forest 회귀는 rxFastTrees의 회귀 트리 학습자를 사용하는 랜덤 포리스트 및 분위수 회귀 포리스트 구현입니다. 이 모델은 의사 결정 트리의 앙상블로 구성되어 있습니다. 의사 결정 포리스트의 각 트리는 예측을 통해 가우스 분포를 출력합니다. 모델의 모든 트리에 대한 결합 분포에 가장 가까운 가우스 분포를 찾기 위해 트리 앙상블에 대해 집계가 수행됩니다.

이 의사 결정 포리스트 분류자는 의사 결정 트리 앙상블로 구성됩니다. 일반적으로 앙상블 모델은 단일 의사 결정 트리에 비해 적용 범위가 넓고 정확도가 높습니다. 의사 결정 포리스트의 각 트리는 예측을 통해 가우스 분포를 출력합니다. 모델의 모든 트리에 대한 결합 분포에 가장 가까운 가우스 분포를 찾기 위해 트리 앙상블에 대해 집계가 수행됩니다.

값

rxFastForest: 학습된 모델이 있는 rxFastForest 개체입니다.

FastForest: Fast Forest 트레이너에 대한 maml 클래스의 학습자 사양 개체입니다.

메모

이 알고리즘은 다중 스레드이며 항상 전체 데이터 세트를 메모리에 로드하려고 시도합니다.

작성자

Microsoft Corporation Microsoft Technical Support

참조

Wikipedia: Random forest

Quantile regression forest

From Stumps to Trees to Forests

추가 정보

rxFastTrees, rxFastLinear, rxLogisticRegression, rxNeuralNet, rxOneClassSvm, featurizeText, categorical, categoricalHash, rxPredict.mlModel.

예


 # Estimate a binary classification forest
 infert1 <- infert
 infert1$isCase = (infert1$case == 1)
 forestModel <- rxFastForest(formula = isCase ~ age + parity + education + spontaneous + induced,
         data = infert1)

 # Create text file with per-instance results using rxPredict
 txtOutFile <- tempfile(pattern = "scoreOut", fileext = ".txt")
 txtOutDS <- RxTextData(file = txtOutFile)
 scoreDS <- rxPredict(forestModel, data = infert1,
    extraVarsToWrite = c("isCase", "Score"), outData = txtOutDS)

 # Print the fist ten rows   
 rxDataStep(scoreDS, numRows = 10)

 # Clean-up
 file.remove(txtOutFile)

 ######################################################################
 # Estimate a regression fast forest

 # Use the built-in data set 'airquality' to create test and train data
 DF <- airquality[!is.na(airquality$Ozone), ]  
 DF$Ozone <- as.numeric(DF$Ozone)
 randomSplit <- rnorm(nrow(DF))
 trainAir <- DF[randomSplit >= 0,]
 testAir <- DF[randomSplit < 0,]
 airFormula <- Ozone ~ Solar.R + Wind + Temp

 # Regression Fast Forest for train data
 rxFastForestReg <- rxFastForest(airFormula, type = "regression", 
     data = trainAir)  

 # Put score and model variables in data frame
 rxFastForestScoreDF <- rxPredict(rxFastForestReg, data = testAir, 
     writeModelVars = TRUE)

 # Plot actual versus predicted values with smoothed line
 rxLinePlot(Score ~ Ozone, type = c("p", "smooth"), data = rxFastForestScoreDF)

다음을 통해 공유

rxFastForest: Fast Forest

사용

인수

formula

data

type

numTrees

numLeaves

minSplit

exampleFraction

featureFraction

splitFraction

numBins

firstUsePenalty

gainConfLevel

trainThreads

randomSeed

mlTransforms

mlTransformVars

rowSelection

transforms

transformObjects

transformFunc

transformVars

transformPackages

transformEnvir

blocksPerRead

reportProgress

verbose

computeContext

ensemble

...