De bibliotheek Microsoft.Extensions.DataIngestion

Het 📦 pakket Microsoft.Extensions.DataIngestion biedt fundamentele .NET-bouwstenen voor gegevensopname. Hiermee kunnen ontwikkelaars documenten lezen, verwerken en voorbereiden voor AI- en machine learning-werkstromen, met name Retrieval-Augmented Generation-scenario's (RAG).

Met deze bouwstenen kunt u robuuste, flexibele en intelligente pijplijnen voor gegevensopname maken die zijn afgestemd op uw toepassingsbehoeften:

  • Geïntegreerde documentweergave: Vertegenwoordig elk bestandstype (bijvoorbeeld PDF, Afbeelding of Microsoft Word) in een consistente indeling die goed werkt met grote taalmodellen.
  • Flexibele gegevensopname: Lees documenten uit zowel cloudservices als lokale bronnen met behulp van meerdere ingebouwde lezers, zodat u eenvoudig gegevens kunt ophalen van waar deze zich ook bevinden.
  • Ingebouwde AI-verbeteringen: Inhoud automatisch verrijken met samenvattingen, sentimentanalyse, trefwoordextractie en classificatie, waarbij uw gegevens worden voorbereid op intelligente werkstromen.
  • Aanpasbare segmenteringsstrategieën: Splits documenten in segmenten met behulp van op tokens gebaseerde, sectiegebaseerde of semantische benaderingen, zodat u kunt optimaliseren voor uw behoeften voor het ophalen en analyseren.
  • Opslag die gereed is voor productie: Sla verwerkte segmenten op in populaire vectordatabases en documentarchieven, met ondersteuning voor het genereren van insluitingen, zodat uw pijplijnen klaar zijn voor echte scenario's.
  • End-to-end pijplijnsamenstelling: Koppel lezers, processors, chunkers en schrijvers aan de IngestionPipeline<T> API, verminder de standaardplaat en maak het eenvoudig om volledige werkstromen te bouwen, aan te passen en uit te breiden.
  • Prestaties en schaalbaarheid: Deze onderdelen zijn ontworpen voor schaalbare gegevensverwerking en kunnen grote hoeveelheden gegevens efficiënt verwerken, waardoor ze geschikt zijn voor hoogwaardige toepassingen.

Al deze onderdelen zijn standaard open en uitbreidbaar. U kunt aangepaste logica en nieuwe connectors toevoegen en het systeem uitbreiden om opkomende AI-scenario's te ondersteunen. Door te standaardiseren hoe documenten worden weergegeven, verwerkt en opgeslagen, kunnen .NET-ontwikkelaars betrouwbare, schaalbare en onderhoudbare gegevenspijplijnen bouwen zonder het wiel opnieuw uit te vinden voor elk project.

Gebouwd op stabiele fundamenten

Diagram gegevensopnamearchitectuur

Deze bouwstenen voor gegevensopname zijn gebouwd op basis van bewezen en uitbreidbare onderdelen in het .NET-ecosysteem, waardoor betrouwbaarheid, interoperabiliteit en naadloze integratie met bestaande AI-werkstromen mogelijk zijn:

  • Microsoft.ML.Tokenizers: Tokenizers bieden de basis voor het segmenteren van documenten op basis van tokens. Dit maakt het nauwkeurig splitsen van inhoud mogelijk, wat essentieel is voor het voorbereiden van gegevens voor grote taalmodellen en het optimaliseren van ophaalstrategieën.
  • Microsoft.Extensions.AI: Deze set bibliotheken zorgt voor verrijkingstransformaties met behulp van grote taalmodellen. Het maakt functies mogelijk zoals samenvatting, sentimentanalyse, trefwoordextractie en het genereren van insluiten van trefwoorden, waardoor u uw gegevens eenvoudig kunt verbeteren met intelligente inzichten.
  • Microsoft.Extensions.VectorData: Deze set bibliotheken biedt een consistente interface voor het opslaan van verwerkte segmenten in een groot aantal vectorarchieven, waaronder Qdrant, Azure SQL, CosmosDB, MongoDB, ElasticSearch en nog veel meer. Dit zorgt ervoor dat uw gegevenspijplijnen gereed zijn voor productie en kunnen worden geschaald op verschillende back-ends van opslag.

Naast vertrouwde patronen en hulpprogramma's zijn deze abstracties gebaseerd op reeds uitbreidbare onderdelen. Invoegtoepassingen en interoperabiliteit zijn van cruciaal belang, dus naarmate de rest van het .NET AI-ecosysteem groeit, groeien de mogelijkheden van de gegevensopnameonderdelen ook. Deze aanpak stelt ontwikkelaars in staat om eenvoudig nieuwe providers, verrijkingen en opslagopties te integreren, zodat hun pijplijnen toekomstklaar en aanpasbaar blijven aan veranderende AI-scenario's.

Zie ook