이 글은 Python용 Azure Storage 클라이언트 라이브러리를 사용하여 블롭을 나열하는 방법을 보여줍니다.
비동기 API를 이용해 블롭을 나열하는 방법에 대해 배우려면 비 동기 블롭 목록(List blobs asynchronously)을 참조하세요.
필수 조건
- Azure 구독 - 체험 구독 만들기
- Azure Storage 계정 - 스토리지 계정 만들기
- Python 3.8+
환경 설정
기존 프로젝트가 없는 경우, 이 섹션에서는 Python Azure Blob Storage 클라이언트 라이브러리를 사용해서 작동하도록 프로젝트를 설정하는 방법을 보여 줍니다. 자세한 내용은 Azure Blob Storage 및 Python 시작을 참조하세요.
이 문서의 코드 예제를 사용하려면 다음 단계에 따라 프로젝트를 설정합니다.
패키지 설치
pip install를 사용하여 다음 패키지를 설치합니다.
pip install azure-storage-blob azure-identity
import 문을 추가합니다
다음 import 문을 추가합니다.
from azure.identity import DefaultAzureCredential
from azure.storage.blob import BlobServiceClient, ContainerClient, BlobPrefix
권한 부여
권한 부여 메커니즘에는 Blob을 나열하는 데 필요한 권한이 있어야 합니다. Microsoft Entra ID(권장)로 인증하려면 Azure RBAC 내장 역할인 Storage Blob Data Reader 이상이 필요합니다. 자세한 내용은 Blob 목록(REST API)에 대한 권한 부여 지침을 참조하세요.
클라이언트 개체 만들기
Blob Storage에 앱을 연결하려면 BlobServiceClient의 인스턴스를 만듭니다. 다음 예에서는 권한 부여를 위해 DefaultAzureCredential을 사용하여 클라이언트 개체를 만드는 방법을 설명합니다.
# TODO: Replace <storage-account-name> with your actual storage account name
account_url = "https://<storage-account-name>.blob.core.windows.net"
credential = DefaultAzureCredential()
# Create the BlobServiceClient object
blob_service_client = BlobServiceClient(account_url, credential=credential)
특정 컨테이너 또는 Blob에 대한 클라이언트 개체를 직접 또는 BlobServiceClient 개체에서 만들 수도 있습니다. 클라이언트 개체 만들기 및 관리에 대한 자세한 내용은 데이터 리소스와 상호 작용하는 클라이언트 개체 만들기 및 관리를 참조하세요.
Blob 목록 옵션 정보
코드에서 블롭을 나열할 때, Azure Storage에서 결과가 어떻게 반환되는지 관리하는 여러 옵션을 지정할 수 있습니다. 각 결과 세트에서 반환할 결과 수를 지정하고 후속 세트를 검색할 수 있습니다. 이름이 해당 문자 또는 문자열로 시작하는 Blob을 반환하는 접두사를 지정할 수 있습니다. 블롭은 평면 목록 구조나 계층적 구조로 나열할 수 있습니다. 계층형 목록은 폴더로 구성된 것처럼 Blob을 반환합니다.
컨테이너 내 블롭을 평면 목록으로 나열하려면 다음 방법 중 하나를 호출하세요:
- ContainerClient.list_blobs (이름과 함께 각 블롭과 관련된 메타데이터, 태그 및 기타 정보를 선택적으로 포함)
- ContainerClient.list_blob_names(Blob 이름만 반환)
계층적 목록을 사용하여 컨테이너 내 블롭을 나열하려면 다음 메서드를 호출하세요:
- ContainerClient.walk_blobs (이름과 함께 각 블롭과 관련된 메타데이터, 태그 및 기타 정보를 선택적으로 포함)
접두사를 사용하여 결과 필터링
Blob 목록을 필터링하려면 name_starts_with 키워드 인수에 대한 문자열을 지정합니다. 접두사 문자열은 하나 이상의 문자를 포함할 수 있습니다. Azure Storage는 이름이 해당 접두사로 시작하는 블롭만 반환합니다.
단순 목록 및 계층 구조 목록
Azure Storage Blob은 계층형 패러다임(예: 클래식 파일 시스템)이 아닌 플랫 패러다임으로 구성됩니다. 하지만 블롭을 가상 디렉터리 로 정리해 폴더 구조를 모방할 수 있습니다. 가상 디렉터리는 Blob 이름의 일부를 형성하며 구분 기호 문자로 표시됩니다.
Blob을 가상 디렉터리로 구성하려면 Blob 이름에 구분 기호 문자를 사용합니다. 기본 구분 기호 문자는 정방향 슬래시(/)이지만 어떤 문자도 구분 기호로 지정할 수 있습니다.
구분자를 사용해 블롭 이름을 붙이면, 계층적으로 블롭을 나열할 수 있습니다. 계층 구조 목록 작업의 경우 Azure Storage는 부모 개체 아래에 가상 디렉터리와 Blob을 반환합니다. 클래식 파일 시스템을 프로그래밍 방식으로 트래버스하는 방법과 비슷하게 목록 작업을 재귀적으로 호출하여 계층 구조를 트래버스할 수 있습니다.
플랫 목록 사용
기본적으로 목록 작업은 Blob을 플랫 목록으로 반환합니다. 플랫 목록에서는 blob이 가상 디렉터리별로 구성되지 않습니다.
다음 예시는 지정된 컨테이너 내 블롭들을 평면 나열을 사용하여 나열합니다:
def list_blobs_flat(self, blob_service_client: BlobServiceClient, container_name):
container_client = blob_service_client.get_container_client(container=container_name)
blob_list = container_client.list_blobs()
for blob in blob_list:
print(f"Name: {blob.name}")
샘플 출력은 다음과 유사합니다.
List blobs flat:
Name: file4.txt
Name: folderA/file1.txt
Name: folderA/file2.txt
Name: folderA/folderB/file3.txt
결과를 나열하거나 더 많은 정보를 보여주는 필터 옵션도 지정할 수 있습니다. 다음 예제에서는 Blob 및 Blob 태그를 나열하는 방법을 보여 줍니다.
def list_blobs_flat_options(self, blob_service_client: BlobServiceClient, container_name):
container_client = blob_service_client.get_container_client(container=container_name)
blob_list = container_client.list_blobs(include=['tags'])
for blob in blob_list:
print(f"Name: {blob['name']}, Tags: {blob['tags']}")
샘플 출력은 다음과 유사합니다.
List blobs flat:
Name: file4.txt, Tags: None
Name: folderA/file1.txt, Tags: None
Name: folderA/file2.txt, Tags: None
Name: folderA/folderB/file3.txt, Tags: {'tag1': 'value1', 'tag2': 'value2'}
참고
표시된 샘플 출력에서는 단일 구조 네임스페이스가 있는 스토리지 계정이 있다고 가정합니다. 스토리지 계정에 계층적 네임스페이스 기능을 활성화하면 디렉터리가 가상이 아닙니다. 대신 그들은 구체적이고 독립적인 대상입니다. 결과적으로 디렉터리를 목록에 길이가 0인 Blob으로 표시합니다.
계층 구조 네임스페이스로 작업할 때 대체 목록 옵션은 디렉터리 콘텐츠 나열(Azure Data Lake Storage)을 참조하세요.
계층형 목록 사용
목록 작업을 계층형으로 호출하는 경우 Azure Storage는 계층의 첫 번째 수준에서 가상 디렉터리 및 Blob을 반환합니다.
Blob을 계층적으로 나열하려면 다음 메서드를 사용합니다.
다음 예제에서는 계층적 목록을 사용하여 지정된 컨테이너에 있는 Blob을 나열합니다.
depth = 0
indent = " "
def list_blobs_hierarchical(self, container_client: ContainerClient, prefix):
for blob in container_client.walk_blobs(name_starts_with=prefix, delimiter='/'):
if isinstance(blob, BlobPrefix):
# Indentation is only added to show nesting in the output
print(f"{self.indent * self.depth}{blob.name}")
self.depth += 1
self.list_blobs_hierarchical(container_client, prefix=blob.name)
self.depth -= 1
else:
print(f"{self.indent * self.depth}{blob.name}")
샘플 출력은 다음과 유사합니다.
folderA/
folderA/folderB/
folderA/folderB/file3.txt
folderA/file1.txt
folderA/file2.txt
file4.txt
참고
블롭 스냅샷은 계층적 리스트링 연산에 나열할 수 없습니다.
Blob을 비동기적으로 나열
Python용 Azure Blob Storage 클라이언트 라이브러리는 Blob 목록을 비동기적으로 지원합니다. 프로젝트 설정 요구 사항에 대해 자세히 알아보려면 비동기 프로그래밍을 참조하세요.
비동기 API를 사용하여 블롭을 나열하는 방법은 다음과 같습니다:
다음 import 문을 추가합니다.
import asyncio from azure.identity.aio import DefaultAzureCredential from azure.storage.blob.aio import BlobServiceClient, ContainerClient, BlobPrefixasyncio.run을 사용하여 프로그램을 실행하는 코드를 추가합니다. 이 함수는 이 예시에서 전달된 코루틴main()을 실행하고 이벤트 루프를asyncio관리합니다. 코루틴은 async/await 구문을 사용하여 선언됩니다. 이 예시에서 코루틴은main()먼저 를 사용하여async with최상위 레벨BlobServiceClient을 생성한 후, 블롭을 나열하는 메서드를 호출합니다. 최상위 클라이언트에서만async with를 사용해야 합니다. 최상의 클라이언트에서 만들어진 다른 클라이언트는 동일한 연결 풀을 공유하기 때문입니다.async def main(): sample = BlobSamples() # TODO: Replace <storage-account-name> with your actual storage account name account_url = "https://<storage-account-name>.blob.core.windows.net" credential = DefaultAzureCredential() async with BlobServiceClient(account_url, credential=credential) as blob_service_client: await sample.list_blobs_flat(blob_service_client, "sample-container") if __name__ == '__main__': asyncio.run(main())Blob을 나열하는 코드를 추가합니다. 다음 코드 예시는 플랫 리스트링을 사용하여 블롭을 나열합니다. 코드는 동기식 예시와 동일하지만, 메서드가 키워드
async for를async사용하여 선언되고 메서드를list_blobs호출할 때 사용됩니다.async def list_blobs_flat(self, blob_service_client: BlobServiceClient, container_name): container_client = blob_service_client.get_container_client(container=container_name) async for blob in container_client.list_blobs(): print(f"Name: {blob.name}")
이 기본 설정이 완료되면 이 문서의 다른 예제도 async/await 구문을 사용하여 코루틴으로 구현할 수 있습니다.
Apache Arrow 형식의 리스트 블롭 (미리보기)
Important
Apache Arrow 형식으로 블롭을 나열하는 기능은 현재 PREVIEW 상태입니다. 이 시나리오는 Python용 Azure Blob Storage 클라이언트 라이브러리의 베타(프리뷰) 버전(예azure-storage-blob: 12.31.0b1 또는 이후 프리뷰 릴리스)이 필요합니다. 미리 보기 기능은 서비스 수준 계약 없이 제공되며 프로덕션 워크로드에는 권장되지 않습니다. 일부 기능은 지원되지 않거나 제한된 기능을 가지고 있을 수 있습니다. 자세한 내용은 Microsoft Azure Preview에 대한 추가 사용 약관을 참조하세요.
이 기능은 기존 List Blobs API 위에 구축되었습니다. 기본 XML을 사용하는 대신, 네트워크상 응답 형식으로는 작고 열 기반인 Apache Arrow 형식을 사용합니다. 컨테이너 리스팅 호출에서 단일 옵션을 설정하면 활성화됩니다. Python SDK는 Apache Arrow를 백그라운드에서 해독하면서도 동일한 BlobProperties 객체를 반환합니다. 이 방법은 대형 컨테이너를 열거할 때 리스트 처리량을 개선하고 클라이언트 측 CPU를 줄여줍니다. 이는 애플리케이션이 의존하는 응답 계약을 유지합니다.
Warning
계층적 네임스페이스(Azure Data Lake Storage)가 활성화된 스토리지 계정에서는 Apache Arrow 형식으로 블롭을 나열하는 것이 지원되지 않습니다.
Apache Arrow 형식의 결과를 요청하려면 "arrow" 또는 response_format를 호출할 때 키워드 인수를 로 설정하세요. Apache Arrow 출력을 사용할 때는 반환되는 경로의 범위를 제어하기 위해 end_before 및 start_from 키워드 인수를 설정할 수도 있습니다.
참고
사용하려면 response_format="arrow"nanoarrow 패키지를 설치해야 합니다.
다음 예시는 컨테이너 내 블롭을 나열하고 결과를 Apache Arrow 형식으로 요청합니다:
# response_format="arrow" requires the nanoarrow package to be installed
blob_list = container_client.list_blobs(
name_starts_with="folderA/",
response_format="arrow",
)
for blob in blob_list:
print("Name: " + blob.name)
리소스
Python용 Azure Blob Storage 클라이언트 라이브러리를 사용해 블롭을 나열하는 방법에 대해 더 알고 싶다면 다음 자료를 참고하세요.
코드 샘플
REST API 작업
Python용 Azure SDK는 Azure REST API 위에 구축된 라이브러리를 포함하고 있습니다. 이 라이브러리들을 사용하면 익숙한 Python 패러다임을 통해 REST API 연산과 상호작용할 수 있습니다. Blob을 나열하기 위한 클라이언트 라이브러리 메서드는 다음 REST API 작업을 사용합니다.
- Blob 목록 가져오기 (REST API)
클라이언트 라이브러리 리소스
참고 항목
관련 콘텐츠
- 이 문서는 Python용 Blob Storage 개발자 가이드의 일부입니다. 자세한 내용은 Python 앱 빌드에서 개발자 가이드 문서의 전체 목록을 참조하세요.