Trénování modelů strojového učení

Apache Spark – součást Microsoft Fabric – umožňuje strojové učení ve velkém měřítku. Umožňuje získat přehledy z velkých objemů strukturovaných, nestrukturovaných a streamovaných dat. Trénování modelů v Microsoft Fabric pomocí opensourcových knihoven, jako jsou Apache Spark MLlib, SynapseML a další.

Apache SparkML a MLlib

Apache Spark – součást Microsoft Fabric – je sjednocená opensourcová architektura paralelního zpracování dat. K urychlení analýzy velkých objemů dat používá zpracování v paměti. Spark je vytvořený pro rychlost, snadné použití a pokročilou analýzu. Distribuované výpočty Sparku v paměti odpovídají iterativním algoritmům strojového učení a grafů.

Škálovatelné knihovny strojového učení MLlib a SparkML přinášejí do tohoto distribuovaného prostředí možnosti algoritmického modelování. MLlib poskytuje původní rozhraní API založené na RDD. SparkML je novější balíček, který poskytuje rozhraní API založené na datovém rámci vyšší úrovně pro vytváření kanálů ML. Poskytuje rozhraní API vyšší úrovně založené na datových rámcích pro vytváření kanálů ML. SparkML zatím nepodporuje všechny funkce knihovny MLlib, ale nahrazuje knihovnu MLlib jako standardní knihovnu strojového učení Sparku.

Modul runtime Microsoft Fabric pro Apache Spark obsahuje několik oblíbených opensourcových balíčků pro trénování modelů strojového učení. Tyto knihovny poskytují opakovaně použitelný kód pro vaše projekty. Modul runtime zahrnuje tyto knihovny strojového učení:

  • Scikit-learn – oblíbená knihovna s jedním uzlem pro klasické algoritmy strojového učení. Podporuje většinu algoritmů pod dohledem a bez dohledu a zpracovává dolování dat a analýzu dat.

  • XGBoost – oblíbená knihovna s optimalizovanými algoritmy pro trénování rozhodovacích stromů a náhodných lesů.

  • PyTorch a Tensorflow jsou výkonné knihovny hlubokého učení Pythonu. Pomocí těchto knihoven můžete nastavit počet exekutorů ve fondu na nulu, abyste mohli vytvářet modely s jedním počítačem. I když tato konfigurace nepodporuje Apache Spark, je to jednoduchý nákladově efektivní způsob vytváření modelů s jedním počítačem.

SynapseML

Opensourcová knihovna SynapseML (dříve označovaná jako MMLSpark) pomáhá vytvářet škálovatelné kanály strojového učení (ML). Zrychluje experimentování a umožňuje používat pokročilé techniky, včetně hlubokého učení, u velkých datových sad.

SynapseML poskytuje vrstvu nad rozhraními API nízké úrovně SparkML při vytváření škálovatelných modelů ML. Tato rozhraní API pokrývají indexování řetězců, sestavení vektorů funkcí, převod dat do rozložení vhodných pro algoritmy strojového učení a další. Knihovna SynapseML tyto a další běžné úlohy při vytváření modelů v PySparku zjednodušuje.

Prozkoumejte možnosti pro trénování modelů strojového učení v Apache Sparku v Microsoft Fabric. Další informace najdete tady: