:::note 준수
SharePoint 커넥터는 강화된 보안 및 규정 준수 설정이 활성화된 작업 영역에서의 사용을 지원합니다.
:::
Microsoft SharePoint 구조적, 반구조적 및 구조화되지 않은 파일을 델타 테이블로 수집할 수 있습니다. SharePoint 커넥터는 Unity 카탈로그 거버넌스를 통해 자동 로더, spark.read 및 COPY INTO 비롯한 일괄 처리 및 스트리밍 API를 사용하여 SharePoint 파일의 증분 수집을 지원합니다.
SharePoint 커넥터를 선택하세요
Lakeflow Connect는 두 개의 SharePoint 커넥터를 제공합니다. 둘 다 SharePoint 데이터에 액세스하지만 관리 수준이 다릅니다.
| 커넥터 | Description |
|---|---|
| 관리되는 SharePoint 커넥터 | 완전 관리형 커넥터입니다. 델타 테이블에 데이터를 수집하고 원본과 동기화된 상태로 유지하는 엔터프라이즈 애플리케이션에 대한 간단하고 낮은 유지 관리 커넥터입니다. |
| 표준 SharePoint 커넥터 |
read_files, spark.read, COPY INTO, Auto Loader와 같은 일괄 처리 및 스트리밍 API를 사용해 SQL, PySpark 또는 Lakeflow 파이프라인으로 사용자 지정 수집 파이프라인을 구축합니다. 수집 과정에서 복잡한 변환을 수행할 수 있는 유연성을 제공함과 동시에, 파이프라인을 관리하고 유지하는 데 있어 더 많은 책임을 부여합니다. |
Tip
Databricks는 대부분의 사용 사례에 대해 관리되는 SharePoint 커넥터를 권장합니다. 자동 증분 수집, 광범위한 형식 지원, 유연한 파일 및 폴더 선택과 함께 완전히 관리되는 환경을 제공합니다.
주요 기능
표준 SharePoint 커넥터는 다음을 제공합니다.
- 구조적, 반구조적 및 구조화되지 않은 파일의 수집
- 세분된 인제스트: 특정 사이트, 하위 사이트, 문서 라이브러리, 폴더 또는 단일 파일 인제스트
-
spark.read를 사용한 일괄 처리 및 스트리밍 수집, Auto Loader 및COPY INTO - CSV 및 Excel 같은 구조적 및 반구조화된 형식에 대한 자동 스키마 유추 및 진화
- Unity 카탈로그 연결을 사용하여 자격 증명 스토리지 보호
-
pathGlobFilter를 사용한 패턴 매칭으로 파일 선택
요구 사항
SharePoint 파일을 수집하려면 다음이 있어야 합니다.
- Unity 카탈로그를 사용하도록 설정된 작업 영역입니다.
-
CREATE CONNECTION권한으로 SharePoint 연결을 만들거나 클러스터 액세스 모드에 따라 기존 연결을 사용할 수 있는 적절한 권한입니다.- 전용 액세스 모드:
MANAGE CONNECTION. - 표준 액세스 모드:
USE CONNECTION.
- 전용 액세스 모드:
- Databricks 런타임 버전 17.3 LTS 이상을 사용하는 컴퓨팅입니다.
- OAuth 인증은
Sites.Read.All또는Sites.Selected권한 범위로 설정됩니다. - 선택 사항: Excel 파일을 구문 분석하기 위해 Excel 베타 기능을 사용하도록 설정합니다. Excel 파일 읽기 및 스트리밍을 참조하세요.
연결 만들기
Unity 카탈로그 연결을 만들어 SharePoint 자격 증명을 저장합니다. 연결 설정 프로세스는 표준 커넥터와 관리되는 SharePoint 커넥터 간에 공유됩니다.
OAuth 인증 옵션을 포함한 전체 연결 설정 지침은 SharePoint 수집 설정의 오버뷰 참조하세요.
SharePoint 파일 읽기
파일을 읽으려면 databricks.connection 옵션 및 액세스하려는 SharePoint 리소스를 가리키는 URL을 사용하여 만든 연결을 전달합니다. 제공하는 URL은 수집 범위를 결정합니다.
Databricks Runtime 17.3 LTS 이상에서 지원되는 경로 형식은 다음과 같습니다.
| 경로 형식 | Description |
|---|---|
| 사이트 | 주소 표시줄에서 사이트 URL을 복사합니다.https://mytenant.sharepoint.com/sites/test-site |
| 하위 사이트 | 주소 표시줄에서 하위 사이트 URL을 복사합니다.https://mytenant.sharepoint.com/sites/test-site/test-subsite |
| 문서 라이브러리 |
사이트 콘텐츠에서 라이브러리를 열고 주소 표시줄에서 URL을 복사합니다.https://mytenant.sharepoint.com/sites/test-site/Shared%20Documentshttps://mytenant.sharepoint.com/sites/test-site/custom-drive |
| Folder |
사이트 콘텐츠에서 폴더를 열고 주소 표시줄에서 URL을 복사합니다. 또는 SharePoint 폴더의 Details 창을 열고 Path 옆에 있는 복사 아이콘을 클릭합니다.https://mytenant.sharepoint.com/sites/test-site/Shared%20Documents/Forms/AllItems.aspx?id=%2Fsites...https://mytenant.sharepoint.com/sites/test-site/custom-drive/test-folder |
| File | 파일을 선택하고 오버플로 메뉴(...)를 클릭한 다음 미리 보기를 선택합니다. 주소 표시줄에서 URL을 복사합니다. 또는 SharePoint 파일의 Details 창을 열고 Path 옆에 있는 복사 아이콘을 클릭합니다.https://mytenant.sharepoint.com/sites/test-site/Shared%20Documents/Forms/AllItems.aspx?viewid=1a2b3c...https://mytenant.sharepoint.com/sites/test-site/custom-drive/test-folder/test.csv |
Databricks Runtime 18 LTS 이상에서는 다음 경로 형식에 대한 지원을 추가합니다.
| 경로 형식 | Description |
|---|---|
| 중첩된 하위 사이트 | 주소 표시줄에서 하위 사이트 URL을 복사합니다.https://mytenant.sharepoint.com/sites/test-site/subsite/nested-subsite/nested-nested-subsite |
| 링크 공유 | 파일 또는 폴더를 선택하고 오버플로 메뉴(...)를 클릭한 다음 링크 복사를 선택합니다. Databricks는 공유 링크가 만료되지 않도록 설정하는 것이 좋습니다.https://mytenant.sharepoint.com/:i:/s/test-site/1A2B3C4D5E6F7G8H9I |
| 웹용 Microsoft 365(이전의 Office) | 웹용 Microsoft 365 파일을 열고 주소 표시줄에서 URL을 복사합니다.https://mytenant.sharepoint.com/:x:/r/sites/test-site/_layouts/15/Doc.aspx?sourcedoc=%1A2B... |
Databricks Runtime 19 이상에서는 다음 경로 형식에 대한 지원을 추가합니다.
| 경로 형식 | Description |
|---|---|
| 임차인 | 주소 표시줄에서 테넌트 루트 URL을 복사합니다.https://mytenant.sharepoint.com |
예시
표준 SharePoint 커넥터를 사용하여 파일을 읽는 몇 가지 방법이 있습니다.
자동 로더를 사용하여 SharePoint 파일을 스트림
자동 로더는 SharePoint 구조화된 파일을 증분 방식으로 수집하는 가장 효율적인 방법을 제공합니다. 새 파일을 자동으로 검색하고 도착하는 동안 처리합니다. 또한 자동 스키마 유추 및 진화를 통해 CSV 및 JSON과 같은 구조적 및 반구조화된 파일을 수집할 수도 있습니다. 자동 로더 사용에 대한 자세한 내용은 일반 데이터 로드 패턴을 참조하세요.
# Incrementally ingest new PDF files
df = (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.option("cloudFiles.schemaLocation", "<path-to-schema-location>")
.option("pathGlobFilter", "*.pdf")
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
)
# Incrementally ingest CSV files with automatic schema inference and evolution
df = (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "csv")
.option("databricks.connection", "my_sharepoint_conn")
.option("cloudFiles.schemaLocation", "<path-to-schema-location>")
.option("pathGlobFilter", "*.csv")
.option("cloudFiles.inferColumnTypes", True)
.option("header", True)
.load("https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs")
)
Spark 일괄 처리를 사용하여 SharePoint 파일 읽기
다음 예제에서는 spark.read 함수를 사용하여 Python SharePoint 파일을 수집하는 방법을 보여줍니다.
# Read unstructured data as binary files
df = (spark.read
.format("binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.option("recursiveFileLookup", True)
.option("pathGlobFilter", "*.pdf") # optional. Example: only ingest PDFs
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents"))
# Read a batch of CSV files, infer the schema, and load the data into a DataFrame
df = (spark.read
.format("csv")
.option("databricks.connection", "my_sharepoint_conn")
.option("pathGlobFilter", "*.csv")
.option("recursiveFileLookup", True)
.option("inferSchema", True)
.option("header", True)
.load("https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs"))
# Read a specific Excel file from SharePoint, infer the schema, and load the data into a DataFrame
df = (spark.read
.format("excel")
.option("databricks.connection", "my_sharepoint_conn")
.option("headerRows", 1) # optional
.option("dataAddress", "Sheet1!A1:M20") # optional
.load("https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx"))
Spark SQL을 사용하여 SharePoint 파일 읽기
다음 예제에서는 read_files 테이블 반환 함수를 사용하여 SQL에서 SharePoint 파일을 수집하는 방법을 보여줍니다.
read_files 사용에 대한 자세한 내용은 테이블 값 함수read_files를 참조하세요.
-- Read pdf files
CREATE TABLE my_table AS
SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile",
pathGlobFilter => "*.pdf", -- optional. Example: only ingest PDFs
schemaEvolutionMode => "none"
);
-- Read a specific Excel sheet and range
CREATE TABLE my_sheet_table AS
SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx",
`databricks.connection` => "my_sharepoint_conn",
format => "excel",
headerRows => 1, -- optional
dataAddress => "Sheet1!A2:D10", -- optional
schemaEvolutionMode => "none"
);
증분 수집 COPY INTO
COPY INTO 는 델타 테이블에 파일을 증분으로 멱등하게 로드합니다.
COPY INTO 사용 방법에 대한 자세한 내용은 COPY INTO을(를) 사용한 일반적인 데이터 로드 패턴을 참조하세요.
CREATE TABLE IF NOT EXISTS sharepoint_pdf_table;
CREATE TABLE IF NOT EXISTS sharepoint_csv_table;
CREATE TABLE IF NOT EXISTS sharepoint_excel_table;
# Incrementally ingest new PDF files
COPY INTO sharepoint_pdf_table
FROM "https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents"
FILEFORMAT = BINARYFILE
PATTERN = '*.pdf'
FORMAT_OPTIONS ('databricks.connection' = 'my_sharepoint_conn')
COPY_OPTIONS ('mergeSchema' = 'true');
# Incrementally ingest CSV files with automatic schema inference and evolution
COPY INTO sharepoint_csv_table
FROM "https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs"
FILEFORMAT = CSV
PATTERN = '*.csv'
FORMAT_OPTIONS ('databricks.connection' = 'my_sharepoint_conn', 'header' = 'true', 'inferSchema' = 'true')
COPY_OPTIONS ('mergeSchema' = 'true');
# Ingest a single Excel file
COPY INTO sharepoint_excel_table
FROM "https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx"
FILEFORMAT = EXCEL
FORMAT_OPTIONS ('databricks.connection' = 'my_sharepoint_conn', 'headerRows' = '1')
COPY_OPTIONS ('mergeSchema' = 'true');
Lakeflow 파이프라인에서 SharePoint 파일 수집
비고
SharePoint 커넥터에는 Databricks Runtime 17.3 이상이 필요합니다. 커넥터를 사용하려면 파이프라인 설정에서 설정합니다 "CHANNEL" = "PREVIEW" . 미리 보기에 대한 자세한 내용은 파이프라인 속성 참조를 참조하세요.
다음 예제에서는 Lakeflow 파이프라인에서 자동 로더를 사용하여 SharePoint 파일을 읽는 방법을 보여 줍니다.
Python
from pyspark import pipelines as dp
# Incrementally ingest new PDF files
@dp.table
def sharepoint_pdf_table():
return (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.option("pathGlobFilter", "*.pdf")
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
)
# Incrementally ingest CSV files with automatic schema inference and evolution
@dp.table
def sharepoint_csv_table():
return (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "csv")
.option("databricks.connection", "my_sharepoint_conn")
.option("pathGlobFilter", "*.csv")
.option("cloudFiles.inferColumnTypes", True)
.option("header", True)
.load("https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs")
)
# Read a specific Excel file from SharePoint in a materialized view
@dp.table
def sharepoint_excel_table():
return (spark.read.format("excel")
.option("databricks.connection", "my_sharepoint_conn")
.option("headerRows", 1) # optional
.option("inferColumnTypes", True) # optional
.option("dataAddress", "Sheet1!A1:M20") # optional
.load("https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx")
SQL
-- Incrementally ingest new PDF files
CREATE OR REFRESH STREAMING TABLE sharepoint_pdf_table
AS SELECT * FROM STREAM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
format => "binaryFile",
`databricks.connection` => "my_sharepoint_conn",
pathGlobFilter => "*.pdf");
-- Incrementally ingest CSV files with automatic schema inference and evolution
CREATE OR REFRESH STREAMING TABLE sharepoint_csv_table
AS SELECT * FROM STREAM read_files(
"https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs",
format => "csv",
`databricks.connection` => "my_sharepoint_conn",
pathGlobFilter => "*.csv",
header => "true");
-- Read a specific Excel file from SharePoint in a materialized view
CREATE OR REFRESH MATERIALIZED VIEW sharepoint_excel_table
AS SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx",
`databricks.connection` => "my_sharepoint_conn",
format => "excel",
headerRows => 1, -- optional
dataAddress => "Sheet1!A2:D10", -- optional
`cloudFiles.schemaEvolutionMode` => "none"
);
구조화되지 않은 파일 구문 분석
표준 SharePoint 커넥터와 binaryFile 형식의 표준 SharePoint 커넥터를 사용하여 SharePoint(예: PDF, Word 문서 또는 PowerPoint 파일)에서 구조화되지 않은 파일을 수집하면 파일 내용이 원시 이진 데이터로 저장됩니다. RAG, 검색, 분류 및 문서 이해와 같은 AI 작업에 필요한 파일을 준비하려면 이진 콘텐츠를 구조화된 쿼리 가능 출력 ai_parse_document으로 변환할 수 있습니다.
다음 예제에서는 이름이 documents브론즈 델타 테이블에 저장된 구조화되지 않은 문서를 구문 분석하고 구문 분석된 내용이 있는 새 열을 추가하는 방법을 보여 줍니다.
CREATE TABLE documents AS
SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile",
pathGlobFilter => "*.{pdf,docx}",
schemaEvolutionMode => "none"
);
SELECT *, ai_parse_document(content, map('version', '2.0')) AS parsed_content
FROM documents;
열에는 parsed_content 다운스트림 AI 파이프라인에 직접 사용할 수 있는 추출된 텍스트, 테이블, 레이아웃 정보 및 메타데이터가 포함됩니다.
Lakeflow 파이프라인을 사용한 증분 구문 분석
ai_parse_document를 사용하여 Lakeflow 파이프라인에서 증분 구문 분석을 사용하도록 설정할 수도 있습니다. 새 파일이 SharePoint를 통해 들어오면, 파이프라인이 업데이트되면서 자동으로 처리됩니다.
예를 들어, 원시 바이너리 파일을 수집하는 청동 스트리밍 테이블을 정의한 다음, 파싱된 콘텐츠를 새 열에 배치하는 두 번째 스트리밍 테이블을 만들 수 있습니다:
CREATE OR REFRESH STREAMING TABLE sharepoint_documents_table
AS SELECT * FROM STREAM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
format => "binaryFile",
`databricks.connection` => "my_sharepoint_conn",
pathGlobFilter => "*.{pdf,docx}");
CREATE OR REFRESH STREAMING TABLE documents_parsed
AS SELECT
*,
ai_parse_document(content, map('version', '2.0')) AS parsed_content
FROM STREAM sharepoint_documents_table;
이 방법은 다음을 보장합니다.
- 파이프라인이 업데이트될 때마다 새로 인제스트된 SharePoint 파일은 자동으로 파싱됩니다.
- 파싱된 출력은 들어오는 데이터와 동기화됩니다.
- 하류 AI 파이프라인은 항상 up-to날짜 문서 표현을 기반으로 작동합니다.
지원 형식과 고급 옵션, 출력 스키마를 핀 연결하는 옵션을 포함한 ai_parse_document 기능을 참조하세요.
SharePoint 메타데이터 열
_sharepoint_metadata 열은 수집된 파일의 SharePoint 특정 속성에 대한 액세스를 제공하는 숨겨진 메타데이터 열로, Microsoft Graph driveItem 리소스에서 제공됩니다. Databricks Runtime 18 LTS 이상이 필요하며 SharePoint 읽을 때 모든 파일 형식에 사용할 수 있습니다. 반환된 _sharepoint_metadata DataFrame에 열을 포함하려면 읽기 쿼리에서 명시적으로 선택해야 합니다.
데이터 원본에 _sharepoint_metadata 열이 포함된 경우 SharePoint 메타데이터 열의 이름이 중복 제거될 __sharepoint_metadata(추가 선행 밑줄 포함)로 바뀝니다. 이름이 고유할 때까지 추가 밑줄이 추가됩니다.
파일 경로 또는 크기와 같은 일반적인 파일 메타데이터는 열을 사용하여 _metadata 쿼리할 수 있습니다. 자세한 내용은 파일 메타데이터 열을 참조 하세요.
스키마
_sharepoint_metadata 열은 STRUCT로서 다음 필드를 포함합니다. 모든 필드는 null을 허용합니다.
| 이름 | Type | Description | 예시 |
|---|---|---|---|
| item_id | STRING |
항목의 driveItem ID입니다. | 01OMQ3MNLH42C5J675CBEI5CRK7SPKQUTZ |
| site_id | STRING |
항목을 포함하는 SharePoint 사이트의 ID입니다. | mytenant.sharepoint.com,69dc7b12-f92c-498d-9514-596b793a1f77,c6c1db8d-2b8d-48a1-a549-394b63d74725 |
| drive_id | STRING |
항목이 포함된 드라이브의 ID입니다. | b!EnvcaSz5jUmVFFlreTofd43bwcaNK6FIpUk5S2PXRyWTvQraaWQkSpwQEgThHDS- |
| 드라이브 유형 | STRING |
드라이브 유형(예: SharePoint 라이브러리의 경우 documentLibrary 또는 비즈니스용 OneDrive business)입니다. |
documentLibrary |
| parent_id | STRING |
부모 폴더의 driveItem ID입니다. | 01OMQ3MNN6Y2GOVW7725BZO354PWSELRRZ |
| parent_name | STRING |
부모 폴더의 이름입니다. | Shared Documents |
| parent_path | STRING |
부모 폴더의 드라이브 상대 경로입니다. | /drives/b!EnvcaSz5.../root: |
| web_url | STRING |
SharePoint 항목의 브라우저 URL입니다. | https://mytenant.sharepoint.com/sites/TestSite/_layouts/15/Doc.aspx?sourcedoc=... |
| MIME 유형 (mime_type) | STRING |
항목의 MIME 형식입니다. | application/vnd.ms-excel |
| created_by_email | STRING |
항목을 만든 사용자의 전자 메일입니다. | alice@example.onmicrosoft.com |
| created_by_name | STRING |
항목을 만든 사용자의 표시 이름입니다. | Alice Example |
| 생성 타임스탬프 | TIMESTAMP |
항목이 만들어진 시간입니다. | 2025-12-03 13:33:12 |
| 마지막_수정자_이메일 | STRING |
항목을 마지막으로 수정한 사용자의 전자 메일입니다. | alice@example.onmicrosoft.com |
| 최종 수정자 이름 | STRING |
항목을 마지막으로 수정한 사용자의 표시 이름입니다. | Alice Example |
| etag | STRING |
항목의 ETag입니다. 항목 또는 해당 메타데이터가 변경되면 변경합니다. | "{D485E667-FDFB-4810-8E8A-2AFC9EA85279},1" |
| ctag | STRING |
항목의 변경 태그입니다. 항목의 콘텐츠가 변경되는 경우에만 변경됩니다. | "c:{D485E667-FDFB-4810-8E8A-2AFC9EA85279},1" |
| description | STRING |
항목 설명(설정된 경우)입니다. | Q4 financial report |
| 추가 메타데이터 | VARIANT |
Microsoft Graph에서 반환되었으나 위에서 추출되지 않은 다른 driveItem 필드입니다. | {"shared":{"scope":"users"},...} |
비고
additional_metadata 필드는 다음과 같이 VARIANT반환됩니다.
VARIANT 형식참조하세요.
예
다음 예제에서는 읽기 쿼리에 _sharepoint_metadata 열을 포함하는 방법, 열에서 특정 필드를 선택하는 방법, 그리고 additional_metadataVARIANT 필드에서 값을 추출하는 방법을 보여 줍니다.
Python
df = (spark.read
.format("binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
.select("*", "_metadata", "_sharepoint_metadata"))
SQL
SELECT *, _sharepoint_metadata
FROM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile"
);
구조체에서 _sharepoint_metadata 특정 필드를 선택합니다.
df = (spark.read
.format("binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
.select("_sharepoint_metadata.item_id", "_sharepoint_metadata.etag"))
캐스트 연산자를 additional_metadataVARIANT 사용하여 :: 필드에서 값을 추출합니다.
SELECT
*,
_sharepoint_metadata.additional_metadata:shared:scope::STRING AS shared_scope
FROM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile"
);
제한점
표준 SharePoint 커넥터에는 다음과 같은 제한 사항이 있습니다.
- 동일한 쿼리를 사용하여 여러 사이트를 수집할 수 없습니다. 두 사이트에서 수집하려면 두 개의 별도 쿼리를 작성해야 합니다.
- 이
pathGlobFilter옵션을 사용하여 이름으로 파일을 필터링할 수 있습니다. 폴더 경로 기반 필터링은 지원되지 않습니다. - SharePoint 목록 및 .aspx 사이트 페이지는 지원되지 않습니다. 문서 라이브러리의 파일만 지원됩니다.
- SharePoint 서버에 다시 쓰는 것은 지원되지 않습니다.
- 자동 로더
cleanSource(수집 후 원본에서 파일 삭제 또는 보관)는 지원되지 않습니다.
다음 단계
- 고급 스트리밍 수집 패턴에 대한 자동 로더 에 대해 알아보기
- 멱등성의 증분 로드를 위한 탐색 COPY INTO
- 클라우드 개체 스토리지 수집 패턴과 비교
- 작업 예약을 설정하여 수집 워크플로를 자동화하세요.
- Lakeflow 파이프라인을 사용하여 변환을 사용한 종단 간 데이터 파이프라인 구축