Microsoft.Extensions.DataIngestion 패키지는📦 데이터 수집을 위한 기본 .NET 구성 요소를 제공합니다. 이를 통해 개발자는 AI 및 기계 학습 워크플로, 특히 RAG(Retrieval-Augmented Generation) 시나리오에 대한 문서를 읽고, 처리하고, 준비할 수 있습니다.
이러한 구성 요소를 사용하면 애플리케이션 요구 사항에 맞게 조정된 강력하고 유연하며 지능적인 데이터 수집 파이프라인을 만들 수 있습니다.
- 통합 문서 표현: 대용량 언어 모델에서 잘 작동하는 일관된 형식으로 파일 형식(예: PDF, 이미지 또는 Microsoft Word)을 나타냅니다.
- 유연한 데이터 수집: 여러 기본 제공 판독기를 사용하여 클라우드 서비스와 로컬 원본 모두에서 문서를 읽어 어디서나 데이터를 쉽게 가져올 수 있습니다.
- 기본 제공 AI 향상된 기능: 요약, 감정 분석, 키워드 추출 및 분류를 사용하여 자동으로 콘텐츠를 보강하여 지능형 워크플로를 위해 데이터를 준비합니다.
- 사용자 지정 가능한 청크 전략: 검색 및 분석 요구 사항에 맞게 최적화할 수 있도록 토큰 기반, 섹션 기반 또는 의미 체계 인식 방법을 사용하여 문서를 청크로 분할합니다.
- 프로덕션 준비 스토리지: 처리된 청크를 인기 있는 벡터 데이터베이스 및 문서 저장소에 저장하고, 포함 생성을 지원하여 파이프라인을 실제 시나리오에 대비할 수 있도록 합니다.
- 엔드 투 엔드 파이프라인 구성: API를 사용하여 리더, 프로세서, 청커 및 라이터를 연결해 상용구를 줄이고 전체 워크플로를 쉽게 빌드, 커스터마이즈 및 확장할 수 있습니다.
- 성능 및 확장성: 확장 가능한 데이터 처리를 위해 설계된 이러한 구성 요소는 대량의 데이터를 효율적으로 처리할 수 있으므로 엔터프라이즈급 애플리케이션에 적합합니다.
이러한 모든 구성 요소는 기본적으로 열려 있으며 확장할 수 있습니다. 사용자 지정 논리 및 새 커넥터를 추가하고 새로운 AI 시나리오를 지원하도록 시스템을 확장할 수 있습니다. .NET 개발자는 문서가 표현, 처리 및 저장되는 방식을 표준화하여 모든 프로젝트에 대해 "휠을 재창조"하지 않고도 안정적이고 확장 가능하며 유지 관리 가능한 데이터 파이프라인을 빌드할 수 있습니다.
안정적인 기초를 기반으로 구축
이러한 데이터 수집 구성 요소는 .NET 에코시스템에서 입증되고 확장 가능한 구성 요소를 기반으로 구축되어 안정성, 상호 운용성 및 기존 AI 워크플로와의 원활한 통합을 보장합니다.
- Microsoft.ML.Tokenizers: Tokenizer는 토큰을 기반으로 문서를 청크하기 위한 기초를 제공합니다. 이렇게 하면 콘텐츠를 정확하게 분할할 수 있으며, 이는 대규모 언어 모델에 대한 데이터를 준비하고 검색 전략을 최적화하는 데 필수적입니다.
- Microsoft.Extensions.AI: 이 라이브러리 집합은 큰 언어 모델을 사용하여 보강 변환을 지원합니다. 요약, 감정 분석, 키워드 추출 및 포함 생성과 같은 기능을 사용하면 지능형 인사이트를 사용하여 데이터를 쉽게 향상시킬 수 있습니다.
- Microsoft.Extensions.VectorData: 이 라이브러리 집합은 Qdrant, Azure SQL, CosmosDB, MongoDB, ElasticSearch 등을 비롯한 다양한 벡터 저장소에 처리된 청크를 저장하기 위한 일관된 인터페이스를 제공합니다. 이렇게 하면 데이터 파이프라인이 프로덕션에 사용할 준비가 되어 있고 여러 스토리지 백 엔드에서 확장할 수 있습니다.
친숙한 패턴 및 도구 외에도 이러한 추상화는 이미 확장 가능한 구성 요소를 기반으로 합니다. 플러그 인 기능과 상호 운용성이 가장 중요하므로 나머지 .NET AI 에코시스템이 증가함에 따라 데이터 수집 구성 요소의 기능도 증가합니다. 이 접근 방식을 통해 개발자는 새로운 공급자, 보강 및 스토리지 옵션을 쉽게 통합하여 파이프라인을 미래 대비하고 진화하는 AI 시나리오에 맞게 조정할 수 있습니다.
참고하십시오
.NET