فهم المفاهيم الرئيسية
Azure Databricks هو نظام أساسي لخدمة واحدة مع تقنيات متعددة تمكن من العمل مع البيانات على نطاق واسع. عند استخدام Azure Databricks، هناك بعض المفاهيم الرئيسية التي يجب فهمها.
مساحات العمل
مساحة العمل في Azure Databricks هي بيئة آمنة وتعاونية حيث يمكنك الوصول إلى جميع أصول Databricks وتنظيمها، مثل دفاتر الملاحظات والمجموعات والوظائف والمكتبات ولوحات المعلومات والتجارب.
يمكنك فتح مساحة عمل Azure Databricks من مدخل Microsoft Azure، عن طريق تحديد تشغيل مساحة العمل.
يوفر واجهة مستخدم (UI) قائمة على الويب بالإضافة إلى واجهات برمجة تطبيقات REST لإدارة الموارد ومهام سير العمل. يمكن تنظيم مساحات العمل في مجلدات لتنظيم المشاريع أو مسارات البيانات أو أصول الفريق، ويمكن تطبيق الأذونات على مستويات مختلفة للتحكم في الوصول. وهي تدعم التعاون من خلال السماح لعدة مستخدمين - مثل مهندسي البيانات والمحللين وعلماء البيانات - بالعمل معا على دفاتر الملاحظات المشتركة وتتبع التجارب وإدارة التبعيات.
بالإضافة إلى ذلك، ترتبط مساحات العمل بكتالوج الوحدة (عند تمكينها) لإدارة البيانات المركزية، مما يضمن الوصول الآمن إلى البيانات عبر المؤسسة. ترتبط كل مساحة عمل أيضا بمجموعة موارد Azure أساسية (بما في ذلك مجموعة موارد مدارة) تحتوي على موارد الحوسبة والشبكات والتخزين التي يستخدمها Databricks خلف الكواليس.
Notebooks
دفاتر ملاحظات Databricks هي مستندات تفاعلية مستندة إلى الويب تجمع بين التعليمات البرمجية القابلة للتشغيل والتصورات والنص السردي في بيئة واحدة. إنها تدعم لغات متعددة - مثل Python و R و Scala و SQL - وتسمح للمستخدمين بالتبديل بين اللغات داخل نفس دفتر الملاحظات باستخدام الأوامر السحرية. تجعل هذه المرونة دفاتر الملاحظات مناسبة تماما لتحليل البيانات الاستكشافية وتصور البيانات وتجارب التعلم الآلي وبناء مسارات بيانات معقدة.
تم تصميم دفاتر الملاحظات أيضا للتعاون: يمكن للعديد من المستخدمين تحرير الخلايا وتشغيلها في وقت واحد وإضافة تعليقات ومشاركة الرؤى في الوقت الفعلي. تتكامل بإحكام مع مجموعات Databricks، مما يتيح للمستخدمين معالجة مجموعات البيانات الكبيرة بكفاءة، ويمكنهم الاتصال بمصادر البيانات الخارجية من خلال كتالوج الوحدة للوصول إلى البيانات الخاضعة للحكم. بالإضافة إلى ذلك ، يمكن التحكم في دفاتر الملاحظات بالإصدار أو جدولتها كوظائف أو تصديرها للمشاركة خارج النظام الأساسي ، مما يجعلها مركزية لكل من الاستكشاف المخصصومهام سير العمل على مستوى الإنتاج.
تحتوي دفاتر الملاحظات على مجموعة من نوعين من الخلايا: خلايا التعليمات البرمجيةوخلايا Markdown. تحتوي خلايا التعليمات البرمجية على تعليمات برمجية قابلة للتشغيل. تحتوي خلايا Markdown على رمز Markdown الذي يتم عرضه كنص ورسومات. يمكنك تشغيل خلية واحدة أو مجموعة من الخلايا أو دفتر الملاحظات بأكمله.
Clusters
يستفيد Azure Databricks من بنية من طبقتين:
- مستوى التحكم: تتعامل هذه الطبقة الداخلية، التي تديرها Microsoft، مع خدمات الواجهة الخلفية الخاصة بحساب Azure Databricks الخاص بك.
- مستوى الحساب: هذه هي الطبقة الخارجية التي تعالج البيانات وتعيش في اشتراك Azure الخاص بك.
المجموعات هي المحركات الحسابية الأساسية في Azure Databricks. إنها توفر قوة المعالجة المطلوبة لتشغيل مهام هندسة البيانات وعلوم البيانات والتحليلات. تتكون كل مجموعة من عقدة سائق، تنسق التنفيذ، وعقدة عاملة واحدة أو أكثر، والتي تتعامل مع الحسابات الموزعة. يمكن إنشاء المجموعات يدويا باستخدام موارد ثابتة أو تعيينها على التحجيم التلقائي، مما يسمح ل Databricks بإضافة عقد عاملة أو إزالتها وفقا لطلب حمل العمل. تضمن هذه المرونة الاستخدام الفعال للموارد والتحكم في التكاليف.
يوفر Azure Databricks Compute مجموعة واسعة من خيارات الحوسبة المتوفرة لأنواع أحمال العمل المختلفة:
- الحوسبة بدون وحدة خدمة: حوسبة مدارة بالكامل عند الطلب يتم تطويرها أو تقليلها تلقائيا لتلبية احتياجات أحمال العمل. مثالي للفرق التي تريد أوقات بدء تشغيل سريعة ، والحد الأدنى من النفقات العامة للإدارة ، والتوسع المرن.
- الحوسبة الكلاسيكية: المجموعات التي يوفرها المستخدم وتكوينها والتي توفر تحكما كاملا في إعدادات الحوسبة، مثل أحجام الأجهزة الظاهرية والمكتبات وإصدارات وقت التشغيل. الأفضل لأحمال العمل المتخصصة التي تتطلب تخصيصا أو أداء متسقا.
- مستودعات SQL: حساب الموارد المحسنة للتحليلات المستندة إلى SQL واستعلامات BI. يمكن توفير مستودعات SQL إما بلا خادم (مرنة أو مدارة) أو كلاسيكية (مكونة من قبل المستخدم) اعتمادا على متطلبات الحوكمة والأداء.
يتيح لك ذلك تخصيص الحوسبة وفقا لاحتياجات محددة - بدءا من التحليل الاستكشافي في دفاتر الملاحظات، إلى مسارات ETL واسعة النطاق، إلى لوحات المعلومات وإعداد التقارير عالية الأداء.
وقت تشغيل Databricks
Databricks Runtime عبارة عن مجموعة من الإصدارات المخصصة ل Apache Spark التي تتضمن تحسينات في الأداء ومكتبات إضافية. تسهل أوقات التشغيل هذه التعامل مع مهام مثل التعلم الآليومعالجة الرسم البيانيوعلم الجينوم ، مع الاستمرار في دعم معالجة البيانات العامة والتحليلات.
يوفر Databricks إصدارات متعددة لوقت التشغيل ، بما في ذلك إصدارات الدعم طويل الأجل (LTS). يحدد كل إصدار إصدار Apache Spark الأساسي وتاريخ إصداره ومتى سينتهي الدعم. بمرور الوقت، تتبع إصدارات وقت التشغيل القديمة دورة حياة:
- قديمة - متوفرة ولكن لم تعد موصى بها.
- مهمل - تم وضع علامة عليه للإزالة في إصدار مستقبلي.
- نهاية الدعم (EoS) - لا يتم توفير المزيد من التصحيحات أو الإصلاحات.
- نهاية العمر الافتراضي (EoL) - متقاعد ولم يعد متاحا.
إذا تم إصدار تحديث صيانة لإصدار وقت التشغيل الذي تستخدمه، فيمكنك تطبيقه عن طريق إعادة تشغيل نظام المجموعة الخاص بك.
وظائف Lakeflow
توفر وظائف Lakeflow أتمتة سير العمل والتنسيق في Azure Databricks، مما يجعل من الممكن جدولة مهام معالجة البيانات وتنسيقها وتشغيلها بشكل موثوق. بدلا من تشغيل التعليمات البرمجية يدويا، يمكنك استخدام المهام لأتمتة أحمال العمل المتكررة أو على مستوى الإنتاج مثل مسارات ETL أو التدريب على التعلم الآلي أو تحديث لوحة المعلومات.
الوظيفة في Databricks هي في الأساس حاوية لمهمة واحدة أو أكثر. تحدد المهام العمل الذي يتعين القيام به - على سبيل المثال ، تشغيل دفتر ملاحظات ، وتنفيذ مهمة Spark ، واستدعاء التعليمات البرمجية الخارجية ، ...
يمكن تشغيل الوظائف بطرق مختلفة:
- وفقا لجدول زمني (على سبيل المثال ، كل ليلة في منتصف الليل).
- ردا على حدث.
- يدويا عند الحاجة.
نظرا لأنها قابلة للتكرار والمدارة، فإن الوظائف ضرورية لأحمال عمل الإنتاج. إنها تضمن تشغيل خطوط أنابيب البيانات باستمرار ، ويتم تدريب نماذج التعلم الآلي ونشرها بطريقة خاضعة للرقابة ، وتتلقى أنظمة المصب بيانات محدثة ودقيقة.
بحيرة دلتا
Delta Lake هو إطار عمل تخزين مفتوح المصدر يعمل على تحسين موثوقية بحيرات البيانات وقابليتها للتوسع عن طريق إضافة ميزات المعاملات أعلى تخزين الكائنات السحابية، مثل Azure Data Lake Storage. يمكن أن تعاني بحيرات البيانات التقليدية من مشكلات مثل البيانات غير المتسقة أو الكتابة الجزئية أو صعوبات إدارة الوصول المتزامن. تعالج Delta Lake هذه المشكلات من خلال دعم:
- معاملات ACID (ذرية ، اتساق ، عزل ، متانة) لقراءة وكتابة موثوقة.
- معالجة بيانات التعريف القابلة للتطوير بحيث يمكن أن تنمو الجداول إلى مليارات الملفات دون فقدان الأداء.
- تعيين إصدار البيانات والتراجع عنها ، مما يتيح استعلامات السفر عبر الزمن واسترداد الحالات السابقة.
- معالجة موحدة للدفعات والتدفق ، بحيث يمكن لنفس الجدول التعامل مع الابتلاع في الوقت الفعلي وأحمال الدفعات التاريخية.
علاوة على هذا الأساس ، توفر جداول Delta تجريدا مألوفا للجدول يجعل من السهل العمل مع البيانات المنظمة باستخدام استعلامات SQL أو واجهة برمجة تطبيقات DataFrame. جداول دلتا هي تنسيق الجدول الافتراضي في Azure Databricks، مما يضمن تخزين البيانات الجديدة مع ضمانات المعاملات بشكل افتراضي.
Databricks SQL
يوفر Databricks SQLإمكانات تخزين البيانات إلى Databricks Lakehouse ، مما يسمح للمحللين ومستخدمي الأعمال بالاستعلام عن البيانات المخزنة بتنسيقات مفتوحة وتصورها مباشرة في بحيرة البيانات. وهو يدعم ANSI SQL ، بحيث يمكن لأي شخص على دراية ب SQL تشغيل الاستعلامات وإنشاء التقارير وإنشاء لوحات المعلومات دون الحاجة إلى تعلم لغات أو أدوات جديدة.
يتوفر Databricks SQL فقط في المستوى المتميز من Azure Databricks. وهي تشمل:
- محرر SQL لكتابة الاستعلامات وتشغيلها.
- لوحات المعلومات وأدوات التصور لمشاركة الرؤى.
- التكامل مع أدوات ذكاء الأعمال والتحليلات الخارجية.
مستودعات SQL
تعمل جميع استعلامات Databricks SQL على مستودعات SQL (التي كانت تسمى سابقا نقاط نهاية SQL)، وهي موارد حوسبة قابلة للتطوير منفصلة عن التخزين. تتوفر أنواع مختلفة من المستودعات اعتمادا على الأداء والتكلفة واحتياجات الإدارة:
مستودعات SQL بلا خادم
- حوسبة فورية ومرنة مع بدء التشغيل السريع والتوسع التلقائي.
- انخفاض النفقات العامة للإدارة نظرا لأن Databricks يتعامل مع السعة والتصحيح والتحسين.
- كفاءة التكلفة عن طريق التوسع تلقائيا وتجنب تكاليف الموارد الخاملة.
مستودعات SQL الاحترافية
- يدعم الفوتون والإخراج التنبؤي، لكنه لا يدعم إدارة عبء العمل الذكية.
- استخدامه عندما لا يكون الخادم غير متاح، أو عندما يتطلب الأمر شبكات مخصصة (مثل الاتصالات الفيدرالية أو الاتصالات الهجينة/المحلية المشتركة).
مستودعات SQL الكلاسيكية
- يتم تشغيل موارد الحساب في اشتراك Azure الخاص بك، وليس في Databricks.
- يستغرق حوالي 4 دقائق للبدء ويتوسع باستجابة أقل من النظامين بدون خادم.
- يدعم فقط Photon؛ لا يوجد إخراج تنبؤي أو إدارة عبء عمل ذكية.
- استخدمها فقط للاستكشاف التفاعلي الأساسي عندما لا تكون الخيارات بدون خادم أو محترف.
MLflow
MLflow عبارة عن نظام أساسي مفتوح المصدر مصمم لإدارة دورة حياة التعلم الآلي (ML) من طرف إلى طرف. يساعد علماء البيانات ومهندسي التعلم الآلي على تتبع التجارب وإدارة النماذج وتبسيط عملية نقل النماذج من التطوير إلى الإنتاج. يدعم MLflow أيضا مهام سير عمل الذكاء الاصطناعي التوليدي ويتضمن أدوات لتقييم وكلاء الذكاء الاصطناعي وتحسينهم.