Datová platforma pro úlohy AI v Azure

Volba datové platformy zahrnuje pochopení jedinečných problémů s daty, které tato řešení přináší. Řešení GenAI, zejména řešení založená na základních modelech, závisí na různorodých vysoce kvalitních datech a rychlém přístupu k škálovatelným úložištům dat, která podporují vektorové vyhledávání. Cílem je splnit tyto potřeby bez zbytečné složitosti architektury. Pochopení principů efektivního návrhu datového kanálu je nezbytné před vyhodnocením možností platformy.

Při vyhodnocování možností platformy začněte tím, že se zeptáte, jestli skutečně potřebujete další komponenty. Jednodušší architektury se často rychleji nasazují, usnadňují správu a jsou nákladově efektivnější. Zeptejte se sami sebe:

  • Dokáže model dosáhnout očekávaného výkonu pomocí dat z jednoho zdroje?
  • Poskytuje zdrojové úložiště dat už možnosti analýzy nebo vyhledávání, které potřebujete?
  • Jsou zdrojová data už strukturovaná a indexovaná pro AI nebo vektorové vyhledávání?

Pokud je odpověď na většinu těchto otázek ano, nemusí být složitá architektura nutná. Například databáze, jako je Azure Cosmos DB a Azure SQL Database, už podporují vektorové datové typy a vektorové vyhledávání nativně, ale musí být povolené a nakonfigurované. Tyto funkce můžou snížit potřebu samostatných databází indexování nebo specializovaných vektorů, což minimalizuje přesun dat a zároveň zlepšuje výkon.

S tím, jak vaše úloha roste a data pocházejí z více zdrojů, bude rozhodování o platformě složitější. Možná budete muset zvážit řešení, která podporují kanály ETL nebo ELT, specializované indexy vyhledávání a škálovatelné úložiště pro velké datové sady. Každá přidaná funkce by měla sloužit jasnému účelu místo pouhého rozšiřování technologického zásobníku.

Tento článek obsahuje pokyny k výběru datové platformy pro úlohy, ve kterých je potřeba ukládat, zpracovávat nebo analyzovat data. Zaměřuje se na řešení, která podporují generování umělé inteligence (GenAI). Důrazně doporučujeme, abyste pochopili principy dobrého návrhu datových kanálů, než prozkoumáte technologické schopnosti, které tento článek popisuje. Další informace naleznete v tématu Základy návrhu dat.

Doporučení týkající se trénování a vyladění diskriminativních modelů najdete v tématu Aspekty platformy trénování dat.

Důležité informace o platformě úložiště dat

V úlohách umělé inteligence se data obvykle procházejí několika fázemi úložiště a zpracování, které jsou řízené kanály, které jednotlivé kroky propojují. Jednou z důležitých fází je úložiště dat, které obsahuje shromažďované a kombinované informace z více zdrojů. Toto úložiště umožňuje zpracovávat a upřesňovat data, dokud nebudou připravená pro další fázi.

Poznámka:

Tuto komponentu možná nebudete potřebovat ve své architektuře. V některých případech můžete přistupovat k datům přímo ze zdrojových systémů. To však může vést k problémům s výkonem a může tyto systémy přetížit dotazy AI. Může také způsobit problémy s přístupem nebo spolehlivostí. Aby se těmto problémům zabránilo, je obvykle lepší data zkopírovat do vyhrazeného úložiště pro agregaci a zpracování.

Když zvolíte platformu pro toto úložiště, ujistěte se, že dodržuje stejné standardy zabezpečení jako zdrojové systémy, je nákladově efektivní a dobře funguje s úlohami zpracování ETL, ELT nebo EL. Vaše možnosti můžou být různé od jednoduchých řešení úložiště až po rozsáhlé datové platformy v závislosti na požadavcích na objem dat a výkon. Vyhledejte možnost úložiště, která je spolehlivá, škálovatelná a poskytuje dobrou hodnotu pro vaši úlohu.

Tady je několik otázek, které vám pomůžou při výběru technologie úložiště dat.

Dokáže platforma zpracovávat různé formáty dat?

Úložiště dat by mělo být schopné ukládat různé formáty dat a v případě potřeby je mezi nimi převést.

Pokud váš kanál příjmu dat například přináší data z relační databáze i ze souboru JSON, musí podporovat strukturovaná a částečně strukturovaná data. Možná budete chtít převést data do formátu Delta, abyste umožnili bohatší funkce, které poskytuje technologie Delta Lake. Platforma by měla poskytovat integrované nástroje pro tento druh transformace, takže nemusíte psát vlastní kód.

Očekáváte, že uložíte více verzí dat?

Data se v průběhu času mění v hodnotách i struktuře a zdrojové systémy obvykle ukládají pouze aktuální stav. Pokud potřebujete historický kontext, zvolte datovou platformu, která podporuje správu verzí. Bez ní možná budete muset duplikovat datové sady, což zvyšuje složitost.

Správa verzí má další výhody. V některých případech možná budete potřebovat samostatné kopie dat pro různé případy použití. Každá kopie se může vyvíjet nezávisle a platforma by měla spravovat verze u všech kopií, aby zachovala kontext pro vaše modely AI.

Má platforma integrované možnosti správy životního cyklu dat?

Správa životního cyklu dat (DLM) pomáhá řídit růst od vytvoření po odstranění. Vaše platforma by měla automaticky odstraňovat dočasné soubory, spravovat archivovaná data a v případě potřeby podporovat dodržování legislativních požadavků na uchovávání dat. Bez toho mohou data nekontrolovatelně růst, což vede k zbytečnému objemu, který může ztěžovat zpracování. Abyste například zlepšili kvalitu dat, možná budete muset několikrát znovu spustit kroky předběžného zpracování. Platforma by měla automaticky odebrat zprostředkující kopie, pokud už nejsou potřeba.

V jiných případech může být nutné uchovávat data pro dodržování předpisů nebo audity. Hledejte možnosti úložiště, které podporují studenou nebo archivovanou úroveň pro zřídka přístupná data s nižšími náklady.

Podporuje platforma funkce zásad správného řízení dat?

Auditovatelnost je důležitým aspektem úloh umělé inteligence. Vaše platforma by měla udržovat záznamy auditu pro sledování přístupu k datům, zajištění ochrany osobních údajů a dokumentování původu dat. Měl by také podporovat slovník dat nebo katalog, který spravuje metadata, datové typy, účel a rodokmen, zejména v případě, že data pocházejí z více zdrojů.

Kolik dat očekáváte, že se budou ukládat?

Úlohy umělé inteligence generují velké objemy dat, které se můžou dále zvětšovat s více verzemi a dalšími metadaty. Vaše datová platforma by se měla efektivně škálovat pro úložiště i propustnost, zpracovávat vysoké rychlosti příjmu dat, souběžné zápisy a náročné zpracování bez snížení výkonu.

Při výběru platformy zvažte celý pracovní postup, protože příjem dat a zpracování často probíhá současně. Systém by měl podporovat paralelní zpracování a časté přesuny dat a poskytovat telemetrii, která poskytuje jasný přehled o výkonu čtení a zápisu.

Je toto úložiště dat důležité pro spolehlivost vaší úlohy?

Zvolte platformu, která podporuje spolehlivost a škálovatelnost prostřednictvím replikace nebo více instancí. Mnoho úložišť velkých objemů dat používá řadiče, které automaticky distribuují zpracování a zajišťují vysokou dostupnost, když instance přestane být k dispozici.

Data musí být také odolná a přístupná. Ujistěte se, že platforma zaručuje integritu dat, poskytuje přístupná rozhraní API a podporuje funkce zálohování nebo obnovení, pokud by opětovné sestavení dat od začátku bylo nákladné.

Máte nějaká omezení nákladů?

Po splnění požadavků na spolehlivost a výkon zvažte, jak optimalizovat náklady. U mnoha úloh umělé inteligence stačí schéma jednou zapsat, mnohokrát číst a pomáhá řídit výdaje. Základní data by měla být nákladově efektivní pro ukládání a načítání, i když nevyžadují stejnou úroveň odezvy jako produkční databáze. Cílem je vyvážení nákladů, efektivity a výkonu.

Potřebujete podporovat suverenitu dat nebo regionální požadavky na dodržování předpisů?

U úloh, které zpracovávají regulovaná nebo citlivá data, zvažte nasazení v suverénním cloudu, jako je Azure Government, Microsoft Azure provozovaný společností 21Vianet nebo jinými národními partnerskými cloudy. Tato prostředí jsou navržená tak, aby splňovala přísné požadavky na rezidenci dat, ochranu osobních údajů a dodržování předpisů tím, že zajišťují, aby úložiště, zpracování a přístup zůstaly v konkrétních jurisdikcích.

Suverénní cloudy poskytují větší kontrolu a nezávislost nad vašimi daty, což je často požadavek na sektory, jako je státní správa, obrana nebo bankovnictví. Mějte ale na paměti, že některé pokročilé funkce umělé inteligence a datové platformy ještě nemusí být v těchto oblastech dostupné. Před návrhem architektury zkontrolujte dostupnost služeb.

Microsoft Purview slouží k udržování katalogu dat, klasifikace a sledování rodokmenu v těchto prostředích. U vysoce důvěrných úloh zvažte použití důvěrných výpočetních prostředků a klíčů spravovaných zákazníkem k posílení ochrany dat. Musíte ověřit, že vaše nasazení odpovídá regionálním předpisům.

Možnosti technologie

Function Doporučené technologie Alternativy / doplňkové nástroje
Úložiště dat ve více formátech Azure Data Lake Storage Gen2, Microsoft Fabric Lakehouse, Azure Databricks Lakehouse Azure Blob Storage, Azure Synapse Analytics, místní datový sklad
Verzování a sledovatelnost dat Microsoft Fabric Lakehouse, Azure Data Lake Storage Gen2 (s Delta Lake), Azure Databricks (Delta Lake) Git LFS, DVC (správa verzí dat), Apache Iceberg
Správa životního cyklu dat (DLM) Azure Data Lake Storage Gen2 (zásady životního cyklu), Azure Blob Storage (vrstvení), Azure Databricks (optimalizace tabulek) Amazon S3 (zásady životního cyklu), Google Cloud Storage
Zásady správného řízení a katalogizace dat Microsoft Purview, Azure Databricks Unity Catalog Apache Atlas, DataHub, Collibra
Úložiště dat s velkým objemem Azure Data Lake Storage Gen2, Azure Synapse Analytics, Azure Databricks Lakehouse Azure Blob Storage, Hadoop HDFS, Amazon S3

Důležité informace o platformě pro zpracování dat

Platforma pro zpracování dat hraje klíčovou roli při přípravě a transformaci dat, aby byla připravená pro podřízené použití, ať už se jedná o indexování RAG, analýzu nebo jiný případ použití.

Poznámka:

V případě GenAI a rozšířené generace (RAG) je užitečné pochopit rozdíl mezi procesy ETL, ELT a EL.

  • ETL: Extrakce, transformace a následné načítání, typické pro tradiční datové sklady.
  • ELT: Extrahování, načítání a transformace, společné pro datová jezera a nástroje pro velké objemy dat, jako je PySpark.
  • EL: Extrahování a načítání, které se používá ve scénářích RAG, kde nejprve ukládáte dokumenty, a pak proveďte transformace, jako je vytvoření bloků textu nebo extrakce obrázků později.

Zpracování může probíhat na dvou místech:

  • Vrstva příjmu dat Kanál příjmu dat shromažďuje data z různých zdrojů a přesouvá je do vašeho agregovaného úložiště dat. Zároveň často provádí základní předběžné zpracování nebo formátování, aby data byla dotazovatelná. Pokud chcete snížit potřebu vlastního kódu, je nejlepší použít datovou platformu, která zpracovává co největší část tohoto kódu. Při vyhodnocování nástrojů zvažte funkce ETL nebo ELT potřebné k podpoře úloh umělé inteligence, jako je rozšíření dat.

  • Vrstva zpracování Jakmile data přijdou do agregovaného úložiště, obvykle potřebují hlubší zpracování, než budou připravená k indexování nebo použití v modelech AI. Tyto kanály by měly nabízet podobné úrovně spolehlivosti a škálovatelnosti jako vrstva příjmu dat, ale fokus se přesune na transformaci a změnu tvaru dat.

Mezi typické úlohy patří:

  • Rozpoznávání a rozšiřování entit
  • Integrace dalších zdrojů dat
  • Provádění vyhledávání a transformací
  • Čištění nebo odstraňování irelevantních dat

Silná datová platforma pomáhá efektivně automatizovat a orchestrovat tyto operace.

Jaká je podpora připojení ke zdrojům dat?

Platforma by se měla snadno připojit ke zdrojům dat, ze kterých očekáváte příjem, ať už jde o relační databáze, zdroje velkých dat nebo blob storage.

Hledejte předem připravené konektory a integrace s nízkými kódy. V ideálním případě chcete konektory založené na přetažení nebo konfiguraci, které podporují vyhledávání, kopírování dat a správu.

Může platforma zpracovávat různé formáty dat?

Data mají mnoho obrazců: strukturované (SQL, relační tabulky), částečně strukturované (JSON, XML, Parquet) a nestrukturované (dokumenty, obrázky) a streamování (data IoT). Zvolte platformu, která dokáže zpracovat formáty požadované vaším případem použití, přičemž vezmete v úvahu okamžité i dlouhodobé požadavky.

Nabízí platforma funkce pro přípravu a přepracování rozsahu dat?

Než budou vaše data připravená k indexování nebo spotřebě modelu, je potřeba je vyčistit, rozšířit a změnit jejich tvar. Strategie návrhu dat by měly explicitně nastínit požadavky. Dobrá platforma by měla:

  • Odebrání duplicit a vyplnění chybějících hodnot
  • Zpracování stemmování, normalizace a dalších základních úkolů čištění při plánování podpory vyhledávání podle klíčových slov nebo hybridního (klíčová slova+vektorového) vyhledávání.
  • Podpora pokročilých transformací, jako jsou bloky dat, rozšiřování a analýza dokumentů

Pokud vaše úložiště dat tyto operace nativně podporuje, můžete je zpracovávat na místě, aniž byste je přesunuli. V opačném případě pro náročné transformace používejte externí nástroje, jako je Azure Databricks nebo Azure Data Factory.

V některých případech se můžete rozhodnout pro externalizaci části této odpovědnosti na platformu, která podporuje další fázi. Běžným příkladem tohoto přístupu je implementace RAG. Během zpracování jsou dokumenty rozdělené na menší bloky dat, přičemž každý blok dat je uložený jako samostatný řádek v indexu. Tyto datové bloky jsou pak spárovány s vektorovými reprezentacemi, často generovanými prostřednictvím služby OpenAI. Ve službě Azure AI Search se tento proces orchestruje jako součást kanálu rozšiřování během indexování, kde dokumenty zpracovává vložený model (například model vkládání OpenAI) a generuje vektorové reprezentace, které se pak ukládají v indexu.

Je k dispozici integrovaný orchestrátor pro správu pracovních postupů?

Zpracování dat obvykle probíhá jako modulární úlohy, které potřebují složitou koordinaci. Vaše platforma by měla obsahovat orchestrátor pro definování, plánování a monitorování těchto pracovních postupů. Vyhledejte:

  • Podpora závislostí úloh a kontroly, které ověřují posloupnost provádění
  • Flexibilní úpravy pracovních postupů, které umožňují snadné úpravy bez přepsání velkých částí kódu.
  • Možnosti monitorování a protokolování

Mezi oblíbené nástroje patří Azure Data Factory pro svou bohatou sadu funkcí pro správu pracovních postupů nebo Azure Databricks pro složitější orchestraci. Pokud jde o náklady, Apache NiFi nebo Airflow mohou být úspornější alternativy.

Kolik dat očekáváte zpracovat?

Odhadněte, kolik dat budete ingestovat, a četnost příjmu dat. Pokud například očekáváte, že se do indexu denně načte 10 terabajtů dat, platforma by měla podporovat silnou paralelizaci a distribuované spouštění. U menších úloh můžou jednodušší nástroje, jako je Logic Apps, fungovat, ale pro větší objemy jsou data Factory nebo Databricks vhodnější. Pokud chcete škálovatelnost a propustnost, zvažte následující:

  • Objem a frekvence dat
  • Požadavky na latenci s možností tolerance
  • Složitost úlohy

Čištění dat například zahrnuje ověření a potenciálně nahrazení neplatných polí nebo maskování citlivých informací. Tyto úkoly, i když jsou základní, vyžadují významné zdroje, protože každý řádek se zpracovává jednotlivě, což se přidává k celkovému času.

Jaké možnosti monitorování potřebujete?

Kanály zpracování dat by měly mít možnosti monitorování a poskytovat přehled o výkonu a stavu úloh kanálu. Vaše platforma by měla poskytovat:

  • Sledování průběhu úlohy
  • Protokoly, metriky a upozornění pro pochopení chování kanálu
  • Integrace s vaším širším monitorovacím systémem

Identifikujte případné mezery v integrované telemetrii a určete, jaké další monitorování potřebujete implementovat. Toto monitorování může zahrnovat přidání vlastního protokolování nebo metrik pro zaznamenání konkrétních podrobností o krocích úlohy.

Jakou spolehlivost očekáváte u platformy pro zpracování dat?

Zvolte platformu, která minimalizuje jednotlivé body selhání a podporuje opakování neúspěšných úloh. Například hostování vlastní logiky zpracování vyvolané službou Data Factory ve službě Azure Kubernetes Service (AKS) obvykle nabízí silnější spolehlivost než hostování v Azure Logic Apps.

Pokud se vaše data aktualizují zřídka a zpracováváte zpracování prostřednictvím týdenního dávkového zpracování, může být občasné selhání přijatelné. V případě scénářů umělé inteligence v reálném čase ale budete potřebovat vyšší spolehlivost.

Existují nějaká omezení nákladů?

Cílem je vyhnout se nadměrnému inženýrství a vybrat platformu, která vám dnes vyhovuje, a zároveň ponechat prostor pro škálování. Pokud například nepotřebujete pokročilé funkce Databricks, může služba Data Factory nabídnout cenově výhodnější možnost. Opensourcové nástroje, jako je Airflow nebo NiFi, můžou dále snížit náklady.

Jaké jsou požadavky na zabezpečení pro pracovní postupy a data, která zpracováváte?

Požadavky na zabezpečení, ochranu osobních údajů a rezidenci dat by měly být vodítkem pro vaši volbu. V ideálním případě by platforma měla poskytovat integrovanou podporu takové izolace, která umožňuje efektivní a zabezpečenou správu dat. Alespoň se ujistěte, že platforma:

  • Splňuje místní zákony o lokalizaci dat. Možná budete muset spustit samostatné pipeliny pro různé oblasti, jako je jedna pro Evropu a další pro Ameriku, abyste splnili místní předpisy.
  • Podporuje správu identit a přístupu (IAM), aby se zajistilo, že k určitým úlohám nebo krokům v rámci pracovních postupů mají přístup jenom autorizované identity.
  • Umožňuje jemně odstupňované řízení přístupu na úrovni pracovního postupu nebo kroku.

Možnosti technologie

Function Doporučené technologie Alternativy / doplňkové nástroje
Čištění dat Azure Data Factory, Azure Databricks, Microsoft Fabric Dataflows Apache NiFi, Apache Airflow
transformace dat Azure Databricks, Azure Synapse Analytics, Microsoft Fabric Data Engineering Kanály služby Azure Data Factory
Rozšiřování dat Azure Document Intelligence in Foundry Tools, Azure OpenAI Service, Azure AI Search Vlastní rozhraní API Pythonu nebo služby AI třetích stran
Orchestrace pracovních postupů Kanály služby Azure Data Factory, úlohy Databricks Apache Airflow, Apache NiFi
Pracovní postupy RAG Služba Azure OpenAI, Azure AI Search, Azure Databricks Datová věda Microsoft Fabric

Důležité informace o indexu vyhledávání

Index vyhledávání ukládá kontextová nebo uzemněná data odesílaná do koncového bodu odvozování modelu spolu s výzvou. Dotazy indexu jsou důležitou komponentou při přípravě dat odesílaných do modelu v požadavcích na odvozování a musí poskytovat výkon s nízkou latencí.

Na rozdíl od kanálů ETL orientovaných na dávky musí tento index podporovat odvozování v reálném čase, což znamená, že vysoký výkon a spolehlivost nejsou vyjednány. Je určená pro úlohy AI a podporuje funkce, jako je indexování klíčových slov, filtrování a vektorové vyhledávání, které přesahuje možnosti tradičních úložišť dat.

Ideální návrh je vysoce výkonné úložiště dat optimalizované pro čtení, které dokáže zpracovat nepřesné nebo přibližné dotazy a přesto vracet relevantní výsledky. Zvolte technologii indexu a mějte tyto body na paměti.

Jaké typy vyhledávání index vyhledávání podporuje?

Každý požadavek na systém může vést k jednomu nebo více dotazům indexu. Pro rámec generování s načítáním informací (RAG) a další úlohy podporované AI je vektorové vyhledávání nutností. Vektorové vyhledávání umožňuje systému najít sémanticky podobné datové body pomocí vkládání namísto přesných shod klíčových slov.

Kombinace vektorového vyhledávání s fulltextovým vyhledáváním, filtrováním a speciálními datovými typy (například geografické umístění) ale index výrazně zvyšuje.

Návrh dat by měl jasně určovat, které typy hledání jsou potřeba a jak by měly spolupracovat. Další informace najdete v tématu Efektivní dotazování v návrhu dat.

Jak index zpracovává multimodální data?

Úlohy umělé inteligence se často zabývají daty, která zahrnují nejen text, ale také obrázky, zvuk nebo video. Samotný index nedokáže přímo porozumět obrázkům. Takže před přidáním obrázků do indexu je potřeba je buď převést na textovou reprezentaci (pomocí OCR nebo titulků obrázků), ze kterých se vygenerují vkládání, nebo je možné vygenerovat vektorové vkládání přímo z obrázku pomocí modelů obrazu. Index pak může provádět vektorové vyhledávání, což umožňuje sémantické dotazy.

V tomto případě by index vyhledávání měl mít:

  • Podpora vektorového vyhledávání pro ukládání a vkládání dotazů (číselné vektory) odvozené z obrázku.
  • Integrace s externími rozhraními API a službami AI pro extrakci nebo rozšiřování dat během procesu indexování
  • Možnost ukládat extrahovaná pole (text, značky, titulky, vkládání) do příslušných polí schématu jako metadata pro vyhledávání a filtrování.

Podporuje index možnosti automatické aktualizace, když se data ve zdrojích dat změní?

Automatizace je klíčem k udržování aktuálnosti dat. Vyberte index, který podporuje automatické aktualizace nebo přírůstkové aktualizace, když se podkladová data změní.

Pokud tato platforma nativně nenabízí, budete muset implementovat vlastní proces pro detekci a nabízení aktualizací. Snižování zátěže této odpovědnosti na platformu může snížit provozní režii a zjednodušit údržbu, zejména s rostoucími objemy dat.

Může index provádět s velkými objemy dat?

Index se musí efektivně škálovat s rostoucím objemem dat. U úloh, které implementují RAG, je každý dokument často rozdělený do několika bloků dat, což výrazně zvyšuje množství uložených dat.

Zvolená platforma by měla být schopná:

  • Horizontální škálování při růstu dat
  • Udržovat výkon dotazů při vysokém zatížení
  • Ukládání nezpracovaných dat a souvisejících metadat, rozšiřování a entit

Má index integrované funkce spolehlivosti?

Spolehlivost indexu vyhledávání by měla zrcadlit koncový bod odvozování, protože obě jsou součástí stejné cesty pro zpracování v reálném čase.

Každý krok musí splňovat podobné očekávání o provozu a výkonu. Pokud toho chcete dosáhnout, vyhledejte při výběru datové platformy:

  • Možnosti vysoké dostupnosti a redundance zón pro přežití zón a oblastních výpadků.
  • Automatické obnovení a snadné opětovné sestavení indexu, aby se zabránilo použití poškozeného indexu pro odvozování.
  • Možnosti pro aliasy indexů a výměnu, které umožňují aktualizace s žádným výpadkem.

Seznamte se také s režimy selhání systému nebo indikátory stresu, jako je omezování. Například při přeindexování na pozadí může dojít k poklesu propustnosti. Systém může obvykle zpracovávat 50 souběžných uživatelů, ale pouze 30 během této úlohy. Naplánujte časování úloh a kapacitu odpovídajícím způsobem, a to jak pro front-endové dotazy, tak úlohy údržby back-endu.

Jaké jsou hlavní nákladové faktory této technologie?

Náklady na index vyhledávání jsou obvykle založené na využití, takže je důležité modelovat očekávaný objem dat, rychlost dotazů a propustnost.

Většina platforem indexů, jako je Azure AI Search, jsou nabídky PaaS (Platforma jako služba), kde se ceny abstrahují a zobrazují v jednotkách kapacity, úložiště a využití funkcí.

Mějte na paměti:

  • Cenové úrovně a limity škálování
  • Dodatečné náklady z pokročilých funkcí (například extrakce obrázků nebo rozšiřování sady dovedností)
  • Nevyužitá kapacita v nadměrně zřízených úrovních
  • Složitost indexu (počet indexů a omezení souběžných dotazů)

Chcete-li porozumět nákladům spojeným s AI Search, podívejte se na Plánování a správu nákladů na AI Search službu.

Splňují bezpečnostní funkce indexu návrh dat zabezpečení?

Návrh dat by měl jasně specifikovat požadavky na zabezpečení a ochranu osobních údajů a index je musí plně podporovat. Při práci v vývojových nebo testovacích prostředích, která používají skutečná data, se ujistěte, že index splňuje zásady řízení přístupu a sledovatelnosti. Hledejte funkce, jako jsou:

  • Maskování dat a odstranění PII
  • Správa identit klientů prostřednictvím Microsoft Entra ID
  • Řízení přístupu na úrovni dokumentu pro filtrování výsledků na základě identity uživatele

Pokud platforma tyto filtry nativně nepodporuje, zvažte implementaci filtrů na úrovni dotazů jako záložního řešení. Další informace najdete v tématu Filtry zabezpečení pro oříznutí výsledků hledání AI.

Z hlediska zabezpečení sítě by index měl:

  • Podpora řízení výchozího přenosu dat a segmentace sítě
  • Integrace s privátními sítěmi při provozu výpočetního prostředí ve virtuální síti
  • Použití spravovaných identit pro ověřování prostřednictvím ID Microsoft Entra
  • Vyhněte se zveřejnění součástí přímo na veřejném internetu

Embedování může stále vystavit citlivé informace, pokud nejsou správně zabezpečené. Mezi rizika patří inverze vkládání (rekonstrukce původního textu z vektorů), otrava dat (zasazení škodlivých vektorů) a neoprávněný přístup k úložištím nebo zálohám vektorů. Pokud chcete tato rizika zmírnit, použijte bezpečnostní opatření, jako jsou:

  • Šifrování dat v klidu a během přenosu
  • Přísné řízení přístupu
  • Připojení k privátní síti, které je popsáno výše
  • Sledování integrovaných koncových bodů pro anomálie nebo manipulace

Podobně jako u jiných typů dat mají procesy pro odebrání citlivých nebo osobních údajů. Zacházejte s indexy vektorů jako s citlivými úložišti dat, která vyžadují stejnou úroveň zabezpečení a zásad správného řízení jako jiné produkční systémy.

Možnosti technologie

Function Doporučené technologie Alternativy / doplňkové nástroje
Vektorové vyhledávání a sémantické vyhledávání Azure AI Search, Azure Cosmos DB (vektorové vyhledávání), Azure Database for PostgreSQL (pgvector) Pinecone, Weaviate, Chroma, Qdrant
Fulltextové vyhledávání a indexování klíčových slov Azure AI Vyhledávač Elasticsearch, Apache Solr, Azure SQL Database Full-Text Search
Zpracování vícemodálních dat Azure AI Search (se sadami dovedností), Document Intelligence, Azure Vision ve Foundry Tools Vlastní zpracování pomocí rozhraní OPENAI API, Amazon Textract
Automatická aktualizace a indexování dat Azure AI Search (s indexery), spouště služby Azure Data Factory Vlastní řešení dotazování, Apache NiFi, zachytávání dat změn
Vysoká dostupnost a spolehlivost Azure AI Search (redundance zón), Azure Cosmos DB (globální distribuce) Nasazení ve více oblastech, nástroje pro vyrovnávání zatížení, Azure Traffic Manager
Aliasování indexů a aktualizace beze ztráty dostupnosti Azure AI Search (aliasy indexů), Azure Cosmos DB Vzory modro-zeleného nasazení, vlastní logika směrování
Zabezpečení na úrovni dokumentů a řízení přístupu Azure AI Search (filtry zabezpečení), integrace ID Microsoft Entra Vlastní vrstvy autorizace, zabezpečení na úrovni řádků v databázích
Zabezpečení sítě a privátní přístup Azure Private Link, integrace virtuální sítě, spravované identity Brány VPN, Azure Firewall, vlastní skupiny zabezpečení sítě

Důležité úvahy o trénování a doladění

Když navrhujete datovou platformu pro tradiční úlohy strojového učení (ML) nebo jiné úlohy než GenAI, přesune se fokus od odvozování v reálném čase na kvalitu dat, reprodukovatelnost a oddělení prostředí. Tyto úlohy spoléhají na dobře strukturovaná agregovaná data a často zahrnují další vrstvy, jako jsou úložiště funkcí a úložiště dat dávkového odvozování, za účelem optimalizace výkonu modelu a efektivity nákladů.

Důrazně doporučujeme, abyste pochopili principy dobrého návrhu datových kanálů, než prozkoumáte technologické schopnosti, které tento článek popisuje. Další informace najdete v tématu Návrh trénovacích dat.

Plánujete trénování s produkčními daty?

Způsob nasazení modelů určuje, jak úzce jsou produkční data svázána s vaším vývojovým prostředím. Existují dva hlavní přístupy k nasazení:

  • Nasazení modelu Model se vytrénuje nebo ladí pomocí produkčních dat během vývoje. Tento přístup může zlepšit význam modelu, ale vyžaduje silné bezpečnostní prvky, protože citlivá data se používají mimo produkční prostředí.

  • Nasazení kódu Model se vytrénuje pomocí neprodukčních dat ve vývoji a pracuje s reálnými daty jenom po nasazení do produkčního prostředí. Tato metoda zjednodušuje zabezpečení vývoje, ale může zvýšit náklady na výpočetní prostředky a úložiště, protože trénování může být potřeba opakovat v několika prostředích.

Bez ohledu na přístup by vaše datová platforma měla jasně oddělit vývojová a produkční prostředí a zajistit správnou izolaci a řízení přístupu.

Upřednostňujete přednost před funkčností?

Při volbě datové platformy pro strojové učení se nerozhodujte výhradně na základě podpory notebooků.

Poznámkové bloky jsou skvělé pro průzkumnou analýzu dat, ale nejsou rozhodovacím faktorem pro výběr datové platformy na produkční úrovni. Výpočetní prostředky notebookové se obvykle nacházejí mimo datové úložiště agregace a jsou integrovány s externími nástroji, jako je Azure Machine Learning nebo Databricks Workspace.

Upřednostněte základní funkce, jako je správa verzí dat, zásady správného řízení, škálovatelnost a zabezpečení, oproti funkcím pohodlí.

Jak budete zpracovávat a připravovat data?

V úlohách ML má model zpracování dat, který zvolíte, velký dopad na flexibilitu a výkon.

  • ETL (extrakce, transformace, načtení) – běžné v tradičních datových skladech, kde omezení schématu vyžadují, abyste před načtením do cílového systému transformovali data.
  • ELT (extrakce, načtení, transformace) – typická pro datová jezera nebo architekturu jezera, kde se nejprve načtou nezpracovaná data, pak se později transformují pomocí nástrojů, jako je Python nebo PySpark.
  • EL (extrakce, načítání) – běžné ve vzorech GenAI a RAG, kde dokumenty nebo média ukládáte jako první a provádíte podřízené transformace (jako jsou bloky textu nebo extrakce obrázků) později.

ELT se často upřednostňuje, protože zachovává nezpracovaná data a umožňuje flexibilnější transformace během přípravy modelu.

Potřebujete úložiště funkcí?

Často je vhodné zavést úložiště funkcí jako meziprostředkující datovou vrstvu mezi agregovaným úložištěm dat a trénovacím prostředím.

Úložiště funkcí funguje jako katalog kurátorovaných funkcí, včetně metadat, jako je rodokmen funkcí, doba generování a zdroj. Je to ideální místo, kde můžete udržovat "zlatá" trénovací data, která je možné opakovaně používat v různých modelech nebo experimentech.

Spravovaná úložiště funkcí, například úložiště funkcí ve službě Azure Machine Learning, se integrují přímo s MLflow a dalšími nástroji pro životní cyklus ML. Umožňují reprodukovatelnost, zásady správného řízení a správu verzí pro vaše funkce.

Zacházejte s úložištěm funkcí jako s citlivým úložištěm dat ve svém vlastním vlastnictví pomocí správných řízení přístupu, šifrování a auditování.

Měli byste použít úložiště dat dávkového odvozování?

V některých případech můžete zvýšit výkon a snížit náklady provedením odvozování v dávkovém provedení, tj. výsledků odvození před computingu a jejich uložením pro pozdější použití místo volání modelu v reálném čase.

Tento přístup může být vysoce efektivní, když se opakovaně požadují stejné dotazy nebo předpovědi (například generování nejčastějších dotazů nebo standardních doporučení).

Mezi klíčové výhody patří:

  • Nižší latence a vylepšené uživatelské prostředí zajišťují okamžité poskytování výsledků.
  • Jednodušší škálovatelnost, protože inference může být dávkována a distribuována offline.
  • Vylepšená spolehlivost, která zabraňuje zatížení inferenčního koncového bodu v reálném čase.
  • Nižší náklady na výpočetní prostředky vyplývající z dávkového zpracování můžou využívat hardware nižší úrovně.
  • Vestavěné předběžné ověření, při kterém lze ověřit přesnost výsledků před jejich zpřístupněním uživatelům.

Tento přístup ale funguje nejlépe, když se znovu použije významné procento předpovědí. Pokud vaše úloha zahrnuje převážně jedinečné dotazy, nemusí stát za to udržovat úložiště dávkových odvozování kvůli složitosti.

Úložiště dat dávkového odvozování by mělo být optimalizované pro operace čtení, dostatečně škálovatelné pro zpracování velkých datových sad a integrované s agregovaným úložištěm dat.

Mezi technologie, které vyhovují tomuto vzoru, patří Azure Cosmos DB pro rychlý, globálně distribuovaný přístup nebo Azure Table Storage pro jednodušší úlohy náročné na čtení s nižšími náklady.

Možnosti technologie

Function Doporučené technologie Alternativy / doplňkové nástroje
Agregované úložiště dat Azure Data Lake Storage Gen2, Microsoft Fabric Lakehouse, Azure Synapse Analytics Azure Blob Storage, SQL Database, místní datový sklad
Zpracování a transformace dat (ETL/ELT) Azure Data Factory, Azure Databricks (PySpark, SQL), Microsoft Fabric Data Engineering Apache Airflow, Apache NiFi, Synapse Pipelines
Vývojové a školicí prostředí Azure Machine Learning (s integrací MLflow), pracovní prostory Azure Databricks JupyterHub, Kubeflow, Amazon SageMaker
Úložiště funkcí Úložiště funkcí služby Azure Machine Learning, úložiště funkcí Databricks Feast (open source), Tecton
Dávkové odvození Azure Cosmos DB, Azure Table Storage Azure SQL Database, PostgreSQL, Redis Cache
Registr modelů a sledování experimentů MLflow (integrovaný ve službě Azure Machine Learning nebo Databricks) Váhy a biase, Neptune.ai, DVC
Orchestrace a automatizace Kanály služby Azure Data Factory, kanály služby Azure Machine Learning Apache Airflow, Prefect
Zabezpečení a řízení přístupu Microsoft Entra ID (Azure AD), Azure Key Vault, spravované identity HashiCorp Vault, AWS IAM

Další kroky